تحول در هوش مصنوعی صوتی؛ OpenAI مدل GPT-Live-۱ را در API عرضه کرد

شرکت OpenAI با عرضه مدل صوتی GPT-Live-1 در پلتفرم API خود، گام بزرگی برای تغییر تجربه دستیارهای صوتی برداشته است. این فناوری جدید به توسعه‌دهندگان اجازه می‌دهد قابلیت مکالمه کاملاً طبیعی، هم‌زمان و تمام‌دوطرفه (Full Duplex) را به برنامه‌ها و سیستم‌های کاری خود اضافه کنند. مدل جدید برخلاف نسل‌های گذشته، توانایی شنیدن و صحبت کردن هم‌زمان، درک قطعی مکالمه و مدیریت جریان گفت‌وگو را در حین اجرای کارهای پیچیده دارد.

پایان عصر معماری‌های خطی؛ پردازش هم‌زمان صدا

در ساختارهای قدیمی، پردازش صوتی شامل سه مرحله جداگانه بود: تبدیل گفتار به متن، استدلال هوش مصنوعی و در نهایت تبدیل متن به گفتار. این زنجیره باعث ایجاد تاخیر زیاد و قطعی‌های ناخوشایند در جریان کلام می‌شد.

مدل GPT-Live-1 با پردازش یکپارچه و هم‌زمان ورودی و خروجی صوتی، این مشکل را حل کرده است. ابزارها و ویژگی‌های کلیدی این مدل عبارت‌اند از:

  • کنترل کامل لحن و سرعت: تنظیم سبک صحبت کردن از طریق دستورهای پایه (System Prompt).

  • قابلیت‌های پیشرفته صوتی: شامل رونوشت هم‌زمان (ASR)، تشخیص حروف و اعداد، تقویت کلمات کلیدی و مدیریت طبیعی نوبت صحبت.

  • پشتیبانی از مدل‌های کمکی: امکان اتصال هم‌زمان به مدل‌های قدرتمند استدلال مانند GPT-6 Astra یا Codex در پس‌زمینه.

GPT-Live-1

کاربرد در خدمات مشتریان و پشتیبانی تلفنی

طراحی این مدل به‌گونه‌ای است که در محیط‌های شلوغ یا هنگام سکوت، عملکرد هوشمندانه‌ای دارد و میان حرف کاربر نمی‌پرد. این ویژگی، GPT-Live-1 را به گزینه‌ای عالی برای اتوماسیون مرکز تماس، رزرو تلفنی و پاسخ‌گویی به مشتریان تبدیل می‌کند.

نتایج اولیه؛ کاهش ۸۰ درصدی کدهای پیچیده و وقفه‌ها

بازخوردهای اولیه نشان‌دهنده جهش بزرگ این مدل در بهینه‌سازی سیستم‌هاست:

  • کاهش قطعی مکالمه: پلتفرم آموزش زبان Speak گزارش داده که این مدل تا ۸۰ درصد وقفه‌های بی‌موقع در صحبت را کاهش داده است.

  • برتری در بنچمارک‌ها: جهش ۳۰ درصدی در آزمون Full Duplex Bench و کسب رتبه نخست در ارزیابی Tau3.

  • کاهش حجم کد: یکی از شرکت‌های حوزه سلامت اعلام کرده با مهاجرت به این مدل، نزدیک به ۲۳ هزار خط کد پیچیده مربوط به مدیریت مکالمه لحظه‌ای را حذف کرده است.

قیمت‌گذاری و تنوع صداها

استفاده از مدل GPT-Live-1 در API با قیمت ۰٫۰۵ دلار به ازای هر دقیقه ارائه می‌شود. این سرویس در زمان عرضه دارای ۱۲ صدای متنوع با لهجه‌ها و گویش‌های گوناگون است. توسعه‌دهندگان برای دسترسی به صداهای اختصاصی یا سفارشی‌سازی‌شده می‌توانند با بخش فروش اوپن‌ای‌آی در ارتباط باشند.