فهرست مطالب
شرکت OpenAI با عرضه مدل GPT-Live-1 در پلتفرم API خود، امکان استفاده از فناوری پیشرفته پردازش صوتی همزمان را برای توسعهدهندگان در حوزههای تجاری و خدماتی فراهم کرد.
به گزارش سرویس اخبار هوش مصنوعی تکناک، OpenAI با ارائه مدل GPT-Live-1، مسیر جدیدی را برای توسعهدهندگان ابزارهای صوتی باز کرده است. این مدل که پیشتر در ChatGPT Voice به کار گرفته شده بود، اکنون به کسبوکارها اجازه میدهد تا دستیارهای صوتی هوشمندی طراحی کنند که برخلاف نمونههای سنتی، قادر به برقراری گفتگوهای طبیعی و روان هستند.
ویژگی کلیدی این مدل، توانایی همزمان گوش دادن و پاسخدهی است که تأخیرهای معمول در دستیارهای صوتی را به حداقل میرساند و تجربه کاربری را به مکالمات انسانی نزدیکتر میکند.
تفکیک وظایف در معماری جدید سیستم
یکی از ویژگیهای متمایز معماری GPT-Live-1، نحوه تفکیک وظایف در پردازشهای سنگین است. این مدل به گونهای طراحی شده که لایه مکالمه را مدیریت کند؛ اموری مانند تشخیص زمان مناسب برای صحبت، مدیریت مکثها و قطعوکلامهای احتمالی کاربر، مستقیماً توسط GPT-Live-1 انجام میشود. در عین حال، برای پردازشهای پیچیدهتر، استدلالهای عمیق یا فراخوانی ابزارهای خاص، سیستم قادر است درخواستها را به مدلهای پشتیبان قویتری مانند GPT-6 Astra ارجاع دهد. این رویکرد به توسعهدهندگان اجازه میدهد تا با استفاده از مدلهای ارزانتر برای وظایف ساده، هزینههای عملیاتی را کاهش داده و در عین حال، گفتگوهای صوتی را بدون وقفه ادامه دهند.

بهبودهای فنی اعمال شده در این نسخه، عملکرد آن را به شکل قابلتوجهی ارتقا داده است. مدل جدید در بنچمارک Full Duplex تا ۳۰ واحد درصدی نسبت به GPT-Realtime-2.1 عملکرد بهتری نشان میدهد. همچنین ترکیب این مدل با GPT-6 Astra باعث شده تا سیستم در بنچمارک Tau3 که معیار سنجش عملکرد عاملهای صوتی از ابتدا تا انتها است، در رتبه نخست قرار گیرد. علاوه بر بهبود عملکرد، قابلیتهای جدیدی نظیر کنترل دقیقتر بر لحن و سرعت گفتار، مدیریت بهینه نویز پسزمینه و پشتیبانی از ادغامهای تلفنی نیز به سیستم اضافه شده است.
افزودن صداها و لهجههای جدید گفتاری
در کنار ارتقای مدل، OpenAI از افزودن مجموعهای از صداهای جدید با لهجهها و زبانهای متنوع خبر داده است. نامهایی مانند Quartz، Ripple، Vesper و چندین مورد دیگر به لیست صداهای قابل انتخاب اضافه شدهاند که تنوع بیشتری را به رابط کاربری برنامههای صوتی میبخشد. این مدلها به ویژه برای کاربردهایی نظیر پشتیبانی مشتری، خدمات رزرو و حوزههای آموزشی و درمانی، گزینههای ایدهآلی محسوب میشوند.
براساس گزارش نئووین، دسترسی به GPT-Live-1 از امروز از طریق پلتفرم API برای تمامی توسعهدهندگان امکانپذیر شده است. هزینه استفاده از این فناوری برای لایه صوتی فرانت-اند ۰.۰۵ دلار در دقیقه تعیین شده و هزینههای مربوط به مدلهای پشتیبان و ابزارهای متصل نیز به صورت جداگانه محاسبه خواهد شد. این عرضه، گام مهمی در جهت یکپارچهسازی هوش مصنوعی صوتی در مقیاس صنعتی است و به شرکتها قدرت میدهد تا تجربهای فراتر از الگوهای رایج چتباتها برای کاربران خود فراهم کنند.

















