فهرست مطالب
گوگل مدل Gemini 3.5 Transcribe را معرفی کرد که بیش از ۸۵ زبان را پشتیبانی میکند و هنگام تبدیل صدا به متن، کلمات اضافی را حذف میکند.
به گزارش سرویس هوش مصنوعی تکناک، گوگل با معرفی چند مدل جدید Gemini 3.5، قابلیتهای Gemini Audio را بهروزرسانی کرده و امکانات تازهای برای رونویسی صدا ارائه داده است.
این مدلها میتوانند اصطلاحات تخصصی و بیش از ۸۵ زبان را بهصورت خودکار تشخیص دهند. Gemini 3.5 Live، Gemini 3.5 Live Experimental و Gemini 3.5 Transcribe با هدف افزایش دقت قابلیتهای صوتی مبتنی بر هوش مصنوعی گوگل طراحی شدهاند و میتوانند هنگام وجود صدای پسزمینه یا قطع شدن صحبت کاربر، عملکرد بهتری داشته باشند.
Gemini 3.5 Transcribe عضو کاملاً جدید خانواده Gemini است و معرفی آن در حالی انجام میشود که همچنان منتظر عرضه Gemini 3.5 Pro هستیم، مدلی که گوگل وعده داده بود در ماه ژوئن عرضه کند.
گوگل میگوید مدل 3.5 Transcribe در مقایسه با مدل قبلی رونویسی این شرکت، یعنی Chirp 3، پیشرفت قابلتوجهی داشته است. این پیشرفت بهویژه در عملکرد چندزبانه و کاهش خطاهای مربوط به کلمات دیده میشود.
این مدل رونویسی به کاربران اجازه میدهد به گفته گوگل، «فقط با صدای خود بهصورت طبیعی متن را ویرایش کنند. Gemini 3.5 Transcribe میتواند متن را بهصورت خودکار قالببندی کند و کلمات پرکننده مانند «اِم» و «اِه» را حذف کند.
کاربران همچنین میتوانند یک واژگان سفارشی در اختیار مدل قرار دهند. در این حالت، 3.5 Transcribe میتواند خود را با شیوههای خاص نوشتن کلمات و اصطلاحات تخصصی تطبیق دهد تا این واژهها بهصورت دستی نیاز به اصلاح نداشته باشند.
این مدل همچنین میتواند در فایلهای صوتی از پیش ضبطشده، صحبتهای حداکثر سه گوینده را از یکدیگر تفکیک کند و برای هر کلمه زمان دقیق آن را ارائه دهد.
مدلهای جدید برای مکالمه صوتی
مدل Transcribe در کنار Gemini 3.5 Live و Gemini 3.5 Live Experimental عرضه شده است. این دو مدل بر پایه فناوری تشخیص گفتاری موجود ساخته شدهاند که حالت مکالمه صوتی Gemini را پشتیبانی میکند.
Gemini 3.5 Live در مدیریت قطع شدن صحبت در میانه جمله، تشخیص زبان و پردازش همزمان محتوای تصویری عملکرد بهتری دارد.
مدل Gemini 3.5 Live Experimental نیز قابلیتهای بیشتری ارائه میدهد و هنگام انجام وظایف پیچیدهتر، روند پیشرفت خود در فرایند استدلال را بهصورت مرحلهبهمرحله و همزمان توضیح میدهد.
بیشتر بخوانید: گوگل قابلیت جلوگیری از تهوع درحرکت را به اندروید آورد

عرضه برای کاربران و توسعهدهندگان
این بهروزرسانیهای Gemini Audio از امروز به زبان انگلیسی برای تمام کاربران اپلیکیشن Gemini در macOS عرضه میشوند. قابلیت دیکته Rambler در اندروید نیز در برخی کشورها و زبانها در دسترس قرار گرفته است.
این قابلیتها همچنین از طریق Gemini API و در قالب پیشنمایش عمومی برای توسعهدهندگان در AI Studio و Antigravity ارائه شدهاند. گوگل اعلام کرده است که پشتیبانی از Chrome نیز بهزودی اضافه خواهد شد.
بیشتر بخوانید: گوگل در حال آزمایش تغییرات کاربردی جدید در جمنای است + تصویر

















