فهرست مطالب
شرکتهای OpenAI و علیبابا با معرفی نسل جدید مدلهای صوتی هوش مصنوعی، رقابت در حوزه پردازش گفتار، رونویسی خودکار و مکالمههای صوتی بلادرنگ را وارد مرحله تازهای کردهاند.
به گزارش سرویس هوش مصنوعی تکناک، شرکت OpenAI دو مدل GPT-Live-Transcribe و GPT-Transcribe را عرضه کرده است که هرکدام برای نیاز متفاوتی توسعه یافتهاند. مدل GPT-Live-Transcribe با تمرکز بر تبدیل گفتار زنده به متن با کمترین تاخیر طراحی شده، در حالی که GPT-Transcribe برای تحلیل فایلهای صوتی ضبطشده و پردازشهای گسترده و غیرهمزمان بهینه شده است.
بیشتر بخوانید: سم آلتمن خواستار کاهش سرعت توسعه هوش مصنوعی شد
01
از 02ویژگی نسل جدید مدلهای صوتی هوش مصنوعی
ویژگی مهم این مدلها توانایی استفاده از زمینههای سفارشی برای افزایش دقت است. کاربران میتوانند اطلاعاتی مانند اصطلاحات تخصصی، نامهای خاص، کلمات کلیدی و زبان مورد انتظار را در اختیار مدل قرار دهند تا کیفیت رونویسی بهبود پیدا کند. همچنین مدل زنده میتواند از مکالمات قبلی برای درک بهتر ادامه گفتوگو استفاده کند. نتایج آزمایشهای OpenAI نشان میدهد افزودن اطلاعات زمینهای تاثیر قابل توجهی بر عملکرد مدلها داشته است. در بنچمارک Context Aware ASR، دقت معنایی GPT-Live-Transcribe به ۴۴.۶ درصد و GPT-Transcribe به ۴۵.۲ درصد افزایش یافته است. همچنین در آزمایشهای صوتی واقعی، مدلهای جدید OpenAI نرخ خطای کمتری نسبت به نسلهای قبلی خود ثبت کردهاند.

برای مطالعه بیشتر: آنتروپیک از ارزیابی امنیت مدلهای قدرتمند هوش مصنوعی حمایت می کند
در همین حال، علیبابا نیز با معرفی Qwen-Audio-3.0-Realtime Plus و Flash، تمرکز خود را روی مکالمه طبیعی صوتبهصوت گذاشته است. این مدلها امکان گفتوگوی دوطرفه کامل را فراهم میکنند؛ قابلیتی که به کاربران اجازه میدهد در حین پاسخگویی هوش مصنوعی، صحبت آن را متوقف کنند. پشتیبانی از اجرای دستورات و صداهای شبیهسازیشده شخصی نیز از دیگر قابلیتهای این مدلها است.
خبر پیشنهادی: ائتلاف جدید غولهای فناوری برای امنیت هوش مصنوعی
02
از 02شاخص عملکرد مدلها
بر اساس ارزیابی Artificial Analysis، مدل Qwen-Audio-3.0-Realtime Plus با امتیاز ۸۴.۱ درصد در شاخص هوش مصنوعی صوتی از GPT-Realtime-2.1 High شرکت OpenAI با امتیاز ۷۹.۱ درصد پیشی گرفته است. این مدل در زمینههایی مانند استدلال صوتی، مدیریت مکالمه و عملکرد عاملهای هوشمند نیز عملکرد برتری نشان داده است. با وجود این برتری، مدل علیبابا در سرعت شروع پاسخ صوتی ضعف دارد، چرا که حدود چهار ثانیه زمان نیاز دارد تا نخستین خروجی صوتی را ارائه کند، در حالی که مدل رقیب OpenAI تقریبا در ۱.۱۴ ثانیه پاسخگویی را آغاز میکند. معرفی این مدلها نشان میدهد رقابت میان غولهای فناوری برای ساخت دستیارهای صوتی طبیعیتر، سریعتر و دقیقتر همچنان در حال شدت گرفتن است؛ رقابتی که میتواند آینده تعامل انسان با هوش مصنوعی را شکل دهد.
















