تحول در هوش مصنوعی صوتی؛ OpenAI مدل GPT-Live-۱ را در API عرضه کرد
شرکت OpenAI با عرضه مدل صوتی GPT-Live-1 در پلتفرم API خود، گام بزرگی برای تغییر تجربه دستیارهای صوتی برداشته است. این فناوری جدید به توسعهدهندگان اجازه میدهد قابلیت مکالمه کاملاً طبیعی، همزمان و تمامدوطرفه (Full Duplex) را به برنامهها و سیستمهای کاری خود اضافه کنند. مدل جدید برخلاف نسلهای گذشته، توانایی شنیدن و صحبت کردن همزمان، درک قطعی مکالمه و مدیریت جریان گفتوگو را در حین اجرای کارهای پیچیده دارد.
پایان عصر معماریهای خطی؛ پردازش همزمان صدا
در ساختارهای قدیمی، پردازش صوتی شامل سه مرحله جداگانه بود: تبدیل گفتار به متن، استدلال هوش مصنوعی و در نهایت تبدیل متن به گفتار. این زنجیره باعث ایجاد تاخیر زیاد و قطعیهای ناخوشایند در جریان کلام میشد.
مدل GPT-Live-1 با پردازش یکپارچه و همزمان ورودی و خروجی صوتی، این مشکل را حل کرده است. ابزارها و ویژگیهای کلیدی این مدل عبارتاند از:
-
کنترل کامل لحن و سرعت: تنظیم سبک صحبت کردن از طریق دستورهای پایه (System Prompt).
-
قابلیتهای پیشرفته صوتی: شامل رونوشت همزمان (ASR)، تشخیص حروف و اعداد، تقویت کلمات کلیدی و مدیریت طبیعی نوبت صحبت.
-
پشتیبانی از مدلهای کمکی: امکان اتصال همزمان به مدلهای قدرتمند استدلال مانند GPT-6 Astra یا Codex در پسزمینه.
کاربرد در خدمات مشتریان و پشتیبانی تلفنی
طراحی این مدل بهگونهای است که در محیطهای شلوغ یا هنگام سکوت، عملکرد هوشمندانهای دارد و میان حرف کاربر نمیپرد. این ویژگی، GPT-Live-1 را به گزینهای عالی برای اتوماسیون مرکز تماس، رزرو تلفنی و پاسخگویی به مشتریان تبدیل میکند.
نتایج اولیه؛ کاهش ۸۰ درصدی کدهای پیچیده و وقفهها
بازخوردهای اولیه نشاندهنده جهش بزرگ این مدل در بهینهسازی سیستمهاست:
-
کاهش قطعی مکالمه: پلتفرم آموزش زبان Speak گزارش داده که این مدل تا ۸۰ درصد وقفههای بیموقع در صحبت را کاهش داده است.
-
برتری در بنچمارکها: جهش ۳۰ درصدی در آزمون Full Duplex Bench و کسب رتبه نخست در ارزیابی Tau3.
-
کاهش حجم کد: یکی از شرکتهای حوزه سلامت اعلام کرده با مهاجرت به این مدل، نزدیک به ۲۳ هزار خط کد پیچیده مربوط به مدیریت مکالمه لحظهای را حذف کرده است.
قیمتگذاری و تنوع صداها
استفاده از مدل GPT-Live-1 در API با قیمت ۰٫۰۵ دلار به ازای هر دقیقه ارائه میشود. این سرویس در زمان عرضه دارای ۱۲ صدای متنوع با لهجهها و گویشهای گوناگون است. توسعهدهندگان برای دسترسی به صداهای اختصاصی یا سفارشیسازیشده میتوانند با بخش فروش اوپنایآی در ارتباط باشند.

