فهرست مطالب
شرکت متا از مدل صوتی جدیدی با نام Muse Voice Transcribe رونمایی کرده است که میتواند چند گوینده و زبان را بهطور همزمان تشخیص دهد.
به گزارش سرویس هوش مصنوعی تکناک، این مدل نخستین مدل صوتی بلادرنگ این شرکت محسوب میشود و برای تبدیل سریع گفتار به متن طراحی شده است.
مدل Muse Voice Transcribe میتواند صدای بیش از ۲۰ گوینده را در یک جلسه تشخیص دهد. همچنین توانایی کار با چند زبان را به صورت همزمان دارد. متا بیان کرده است که این مدل حتی میتواند تغییر زبان در میانه جمله را نیز تشخیص دهد.
این مدل جدید توسط Meta Superintelligence Lab توسعه پیدا کرده و قرار است در محصولات و ابزارهای مختلف متا مورد استفاده قرار گیرد.
بیشتر بخوانید: گوگل از مدل صوتی جدید Gemini رونمایی کرد؛ حذف خودکار مکثها و کلمات اضافی
مدل Muse Voice Transcribe متا چگونه کار میکند؟
یکی از ویژگیهای مهم این مدل، توانایی تشخیص گویندگان مختلف است. این فناوری میتواند در یک مکالمه، صدای افراد مختلف را از یکدیگر جدا کند و متن هر گوینده را به شکل دقیقتری ثبت نماید.
همچنین این مدل برای عملکرد بلادرنگ طراحی شده است. به گفته متا، Muse Voice Transcribe هنگام شنیدن کلمات دشوار کمی بیشتر منتظر میماند. در مقابل، برای کلمات ساده سریعتر نتیجه را ثبت میکند.
این روش به مدل کمک میکند میان سرعت و دقت تعادل برقرار کند. همچنین متا اعلام کرده که این مدل برای جلسات طولانی نیز طراحی شده است و میتواند مکالماتی با بیش از ۲۰ گوینده را مدیریت کند.

پشتیبانی از بیش از ۷۰ زبان و تغییر زبان در یک جمله
یکی از قابلیتهای جذاب مدل Muse Voice Transcribe متا، پشتیبانی گسترده از زبانها است. متا اعلام کرده که این مدل در فرایند آموزش با بیش از ۷۰ زبان کار کرده و در زمان عرضه، عملکرد آن برای ۲۵ زبان اعتبارسنجی شده است.
این مدل علاوه بر تشخیص زبانهای مختلف، قابلیت مهم دیگری نیز دارد. Muse Voice Transcribe میتواند هنگام صحبت کردن کاربر، تغییر زبان را در میانه جمله تشخیص دهد.
برای مثال، اگر فردی در یک جمله از کلمات متعلق به دو زبان مختلف استفاده کند، مدل میتواند این تغییر را تشخیص دهد و متن را مطابق گفتار اصلی ثبت کند.
این قابلیت که به آن Code-Switching گفته میشود، میتواند برای کاربران چندزبانه کاربرد زیادی داشته باشد.
کاربرد مدل Muse Voice Transcribe در محصولات متا
متا اعلام کرده که این مدلهمین حالا در برخی محصولات جدید این شرکت مورد استفاده قرار گرفته است.
یکی از این محصولات، اپلیکیشن Meta AI برای مک است. این برنامه میتواند قابلیتهای صوتی خود را در سایر اپلیکیشنها نیز فعال کند. در نتیجه، Muse Voice Transcribe اکنون برای قابلیت دیکته صوتی در سرویسهای دیگر نیز کاربرد دارد.
همچنین این مدل در Muse Code و Meta Model API در دسترس توسعهدهندگان قرار گرفته است. قیمت استفاده از API برابر با ۳ دلار برای هر هزار دقیقه صدای پردازششده اعلام شده است.
رقابت متا و گوگل در حوزه مدلهای صوتی
معرفی Muse Voice Transcribe در شرایطی انجام شده است که شرکتهای بزرگ فناوری تمرکز بیشتری روی مدلهای صوتی هوش مصنوعی دارند.
گوگل نیز مدت کوتاهی پیش مدل Gemini 3.5 Transcribe را معرفی کرده بود. این مدل نیز قابلیتهای پیشرفتهای برای تبدیل گفتار به متن ارائه میدهد.
با وجود این، رویکرد شرکتها کمی متفاوت است. گوگل قصد دارد مدل صوتی خود را در اندروید و در آینده در مرورگر کروم به کار بگیرد. هنوز مشخص نیست متا چه برنامهای برای استفاده گستردهتر از مدل Muse Voice Transcribe در سرویسهای اصلی خود دارد.

بیشتر بخوانید: مدل صوتی Grok Voice Think Fast 2.0 از رقبا پیشی گرفت
متا به توسعه مدلهای جدید ادامه میدهد
مدل Muse Voice Transcribe جدیدترین محصول Meta Superintelligence Lab است. این واحد در هفتههای اخیر فعالیت زیادی در حوزه هوش مصنوعی داشته است.
متا پیش از این نیز نخستین عامل اختصاصی خود برای برنامهنویسی، یک مدل Open-Weight و اپلیکیشن Meta AI برای مک را معرفی کرده بود.
عرضه مدل صوتی جدید نشان میدهد متا قصد دارد حضور خود را در بخشهای مختلف هوش مصنوعی گسترش دهد. قابلیتهایی مانند تشخیص چند گوینده، پشتیبانی از زبانهای مختلف و پردازش بلادرنگ میتوانند کاربردهای متنوعی برای کاربران و توسعهدهندگان داشته باشند.
جمعبندی
مدل Muse Voice Transcribe متا یکی از جدیدترین تلاشهای این شرکت برای توسعه فناوریهای صوتی هوش مصنوعی است. این مدل میتواند بیش از ۲۰ گوینده را در مکالمات طولانی تشخیص دهد و با چند زبان به صورت همزمان کار کند.
پشتیبانی از تغییر زبان در میانه جمله نیز یکی از ویژگیهای مهم آن است. این قابلیت میتواند Muse Voice Transcribe را برای جلسات، دیکته صوتی و مکالمات چندزبانه به گزینهای کاربردی تبدیل کند.
در حال حاضر این مدل از طریق برخی محصولات متا و API در اختیار کاربران و توسعهدهندگان قرار گرفته است. باید دید متا در آینده از این فناوری در کدام سرویسهای اصلی خود استفاده خواهد کرد.

















