فهرست مطالب
شرکت xAI مدل تبدیل گفتار به متن Grok Voice Transcribe 2.0 را با کاهش خطای رونویسی چندزبانه و دقت بیشتر نسبت به نسل قبل معرفی کرده است.
به گزارش سرویس هوش مصنوعی تکناک، شرکت Atlassian نیز پس از ارزیابی این مدل، استفاده از آن را برای رونویسی تمام ویدیوهای Loom آغاز کرده است.
شرکت xAI اعلام کرد که این نسخه در محیطهای واقعی، نویزی و چندزبانه، عملکرد دقیقتری نسبت به Grok Voice Transcribe 1.0 ارائه میدهد. این مدل بر پایه همان مدل بنیادی صوتی توسعه یافته است که Grok Voice از آن استفاده میکند.
به گفته xAI، فناوری صوتی Grok روزانه دهها هزار تماس پشتیبانی مشتریان را پردازش میکند، میلیونها ساعت روایت ویدیویی را به متن تبدیل میکند و در محصولاتی مانند دستیار Grok در خودروهای تسلا نیز به کار میرود.
بیشتر بخوانید: مایکروسافت: آموزش هوش مصنوعی بزرگترین سرقت نیروی کار تاریخ است
جهش دقت در رونویسی چندزبانه
مهمترین پیشرفت مدل جدید تبدیل گفتار به متن xAI به رونویسی چندزبانه مربوط میشود. شرکت xAI اعلام کرده است که نرخ خطای کلمات در مجموعهای از عبارتهای کوتاه دستیار صوتی در ۱۹ زبان، از ۲۰.۶ درصد در نسخه قبلی به ۶.۸ درصد کاهش یافته است.
عبارتهای کوتاه برای مدلهای تشخیص گفتار دشوارتر هستند، چرا که اطلاعات زمینهای کمتری برای شناسایی زبان در اختیار مدل قرار میدهند. مدل Grok Voice Transcribe 2.0 میتواند زبان گفتار را بهطور خودکار تشخیص دهد و تغییر زبان در میانه یک فایل صوتی را نیز در یک مرحله دنبال کند.

شرکت xAI مدل جدید را روی چهار مجموعه آزمایشی داخلی نیز ارزیابی کرده است. این مجموعهها شامل تماسهای پشتیبانی مشتری، مکالمات با Grok، اطلاعات شفاهی مانند کد حساب و آدرس ایمیل و فرمانهای صوتی کوتاه چندزبانه هستند. به گفته شرکت، نسخه ۲.۰ در هر چهار مجموعه از نسل قبل دقیقتر بوده است.
این شرکت بیان کرد که Grok Voice Transcribe 2.0 در جدول عمومی Artificial Analysis نیز از نظر دقت میان ۳۲ مدل استریم در جایگاه نخست قرار گرفته است. شرکت xAI این مدل را با گزینههایی مانند Gemini 3.5 Transcribe، MAI-Transcribe-2، ElevenLabs Scribe v2، Deepgram Nova-3 و Whisper Large v3 مقایسه کرده است.
بیشتر بخوانید: حمله سایبری جمنای به سه شرکت در جریان یک آزمایش امنیتی
قابلیتهای API مدل تبدیل گفتار به متن xAI
مدل جدید از طریق API تبدیل گفتار به متن xAI در دسترس است و رونویسی دستهای فایلهای ضبطشده و آدرسهای اینترنتی، همچنین پردازش زنده صوت را پشتیبانی میکند. کاربران میتوانند زمان هر کلمه، میزان اطمینان مدل، تفکیک گویندگان و رونویسی چندکاناله تا هشت کانال را نیز دریافت کنند.
این سرویس امکان اولویتدهی به حداکثر ۱۰۰ اصطلاح تخصصی، قالببندی خودکار اعداد، تاریخها، ارزها، شماره تلفنها و آدرسهای ایمیل، حذف کلمات زائد و تشخیص پایان نوبت صحبت را نیز ارائه میدهد. شرکت xAI عنوان کرد که کاربران فعلی API بدون تغییر کد میتوانند از بهبود دقت نسخه جدید استفاده کنند.
طبق مستندات رسمی، این سرویس از ۱۲ فرمت صوتی، فایلهایی با حداکثر حجم ۵۰۰ مگابایت و چند نرخ نمونهبرداری رایج پشتیبانی میکند. قابلیت قالببندی نوشتاری نیز برای ۲۵ زبان در دسترس است.
شرکت Atlassian پس از مقایسه این مدل با راهکار قبلی خود اعلام کرده است که Grok Voice Transcribe 2.0 دقت بیشتری دارد و اکنون همه ویدیوهای Loom با این مدل رونویسی میشوند.
قیمتگذاری نسبت به نسل قبل تغییر نکرده است. هزینه رونویسی دستهای ۰.۱۰ دلار به ازای هر ساعت صوت و هزینه پردازش استریم ۰.۲۰ دلار به ازای هر ساعت است. شرکت xAI اعلام کرده است که نسخه ۲.۰ به زودی مدل پیشفرض API خواهد شد و نسخه ۱.۰ طی هفتههای آینده کنار گذاشته میشود.
بیشتر بخوانید: Grok با دادههای استارتاپهای ورشکسته آموزش میبیند
















