گراک Voice Transcribe ۲.۰ معرفی شد؛ دقت تبدیل گفتار به متن بهبود یافت

شرکت xAI از مدل جدید هوش مصنوعی خود برای تبدیل گفتار به متن با نام Voice Transcribe 2.0 رونمایی کرد. این مدل با تمرکز بر پردازش مکالمات واقعی، صداهای پرنویز و محتوای چندزبانه توسعه یافته و طبق اعلام xAI، نسبت به نسل قبلی یعنی Grok Voice Transcribe 1.0 دقت بالاتری دارد.

با وجود ارتقای عملکرد، قیمت استفاده از این سرویس برای پردازش دسته‌ای تغییری نکرده و همچنان هر ساعت پردازش صوت ۰٫۱۰ دلار هزینه دارد. نرخ استفاده از حالت بلادرنگ نیز ۰٫۲۰ دلار به ازای هر ساعت اعلام شده است.

Voice Transcribe 2.0 چگونه آموزش دیده است؟

مدل جدید بر پایه فناوری صوتی به‌کاررفته در Grok Voice ساخته شده است. xAI می‌گوید این فناوری اکنون در روز برای ده‌ها هزار تماس پشتیبانی مشتری مورد استفاده قرار می‌گیرد و در پروژه‌هایی مانند رونویسی میلیون‌ها ساعت محتوای ویدیویی و اجرای قابلیت‌های صوتی در محصولات مختلف نیز به کار گرفته شده است.

دستیار صوتی Grok در خودروهای تسلا یکی از نمونه‌های استفاده از این فناوری محسوب می‌شود.

برای آموزش Voice Transcribe 2.0، مجموعه‌ای از فایل‌های صوتی واقعی در محیط‌های گوناگون مورد استفاده قرار گرفته است. این داده‌ها علاوه بر چندزبانه بودن، شامل صداهای ضبط‌شده در شرایط پرنویز نیز بوده‌اند. xAI همچنین پس از آموزش اولیه، مراحل دیگری را برای بهینه‌سازی مدل و افزایش عملکرد آن در سناریوهای واقعی انجام داده است.

ادعای xAI درباره دقت Voice Transcribe 2.0

xAI اعلام کرده است که Voice Transcribe 2.0 در میان ۳۲ مدل استریمینگ موجود در جدول عمومی Artificial Analysis، بالاترین دقت را به دست آورده است.

این شرکت برای ارزیابی عملکرد مدل تنها به بنچمارک‌های عمومی اکتفا نکرده و آن را روی چهار مجموعه آزمایشی داخلی نیز بررسی کرده است. این داده‌ها از ترافیک واقعی به دست آمده‌اند و مواردی مانند تماس‌های پشتیبانی تلفنی، مکالمات کاربران با Grok، اطلاعات حساب و ایمیل و فرمان‌های صوتی کوتاه به زبان‌های مختلف را شامل می‌شوند.

طبق نتایج منتشرشده از سوی xAI، Voice Transcribe 2.0 در هر چهار آزمایش عملکرد بهتری نسبت به نسل قبلی داشته است. در آزمایش مربوط به تماس‌های پشتیبانی انگلیسی با کیفیت ۸ کیلوهرتز نیز xAI اعلام کرده مدل جدید در مقایسه با سایر مدل‌های بررسی‌شده عملکرد بهتری داشته است.

گراک Voice Transcribe 2.0

xAI برای مقایسه عملکرد مدل خود، نمونه‌هایی مانند Gemini 3.5 Transcribe، MAI-Transcribe-2، ElevenLabs Scribe v2، Deepgram Nova-3 و Whisper Large v3 را نیز در نمودارهای آزمایشی خود قرار داده است.

کاهش چشمگیر خطای رونویسی در چند زبان

یکی از بخش‌هایی که xAI روی آن تأکید ویژه‌ای دارد، بهبود عملکرد Voice Transcribe 2.0 در تشخیص گفتار چندزبانه است. این مدل می‌تواند زبان صحبت‌کردن را به‌صورت خودکار تشخیص دهد و در صورت تغییر زبان در میانه فایل صوتی، بدون آنکه فایل به بخش‌های جداگانه تقسیم شود، فرایند رونویسی را ادامه دهد.

این قابلیت در تشخیص فرمان‌های کوتاه صوتی اهمیت بیشتری دارد؛ زیرا در چنین شرایطی مدل اطلاعات متنی و زمینه محدودی برای شناسایی زبان در اختیار دارد.

در یکی از آزمایش‌های xAI، عملکرد مدل روی فرمان‌های صوتی دستیار هوشمند در ۱۹ زبان بررسی شده است. بر اساس نتایج اعلام‌شده، نرخ خطای کلمه یا WER در این آزمایش از ۲۰٫۶ درصد در نسل قبلی به ۶٫۸ درصد در Voice Transcribe 2.0 رسیده است.

امکانات Speech-to-Text API گراک

Voice Transcribe 2.0 از طریق Speech-to-Text API در اختیار توسعه‌دهندگان قرار گرفته و امکان تبدیل فایل‌های صوتی و URLها به متن را به‌صورت دسته‌ای یا بلادرنگ فراهم می‌کند.

از جمله قابلیت‌های این API می‌توان به موارد زیر اشاره کرد:

  • ارائه زمان دقیق هر کلمه به همراه امتیاز اطمینان
  • شناسایی و تفکیک گویندگان بدون دریافت هزینه اضافی
  • پشتیبانی از رونویسی چندکاناله تا هشت کانال
  • امکان تعریف حداکثر ۱۰۰ عبارت تخصصی برای افزایش دقت تشخیص کلمات کلیدی
  • قالب‌بندی خودکار اعداد، تاریخ، ارز، شماره تلفن و ایمیل
  • حذف کلمات پرکننده از متن نهایی
  • تشخیص خودکار پایان صحبت برای استفاده در عامل‌های صوتی

یکی از نکات مهم برای توسعه‌دهندگان این است که سرویس‌هایی که پیش‌تر به Speech-to-Text API متصل شده‌اند، می‌توانند از بهبودهای مدل جدید استفاده کنند و طبق اعلام xAI نیازی به تغییر کد نخواهند داشت.

پشتیبانی از ۱۲ فرمت صوتی و فایل‌های ۵۰۰ مگابایتی

مستندات API نشان می‌دهد Voice Transcribe 2.0 از ۱۲ فرمت صوتی پشتیبانی می‌کند و حداکثر حجم فایل قابل پردازش در آن ۵۰۰ مگابایت است.

این سرویس همچنین از نرخ‌های نمونه‌برداری ۸۰۰۰، ۱۶۰۰۰، ۲۲۰۵۰، ۲۴۰۰۰، ۴۴۱۰۰ و ۴۸۰۰۰ هرتز پشتیبانی می‌کند.

از نظر زبان نیز پارامتر زبان API امکان قالب‌بندی خروجی را در ۲۵ زبان فراهم می‌کند. انگلیسی، اسپانیایی، فرانسوی، آلمانی، هندی، ژاپنی و کره‌ای از جمله زبان‌های پشتیبانی‌شده هستند.

قیمت Voice Transcribe 2.0

xAI قیمت مدل جدید را نسبت به Voice Transcribe 1.0 تغییر نداده است. هزینه استفاده از این سرویس بر اساس نوع پردازش به شکل زیر تعیین می‌شود:

نوع پردازش قیمت به ازای هر ساعت صوت
پردازش دسته‌ای (Batch) ۰٫۱۰ دلار
پردازش بلادرنگ (Streaming) ۰٫۲۰ دلار

امکاناتی مانند تشخیص گوینده، تعیین زمان کلمات و استفاده از عبارت‌های تخصصی نیز بدون هزینه جداگانه در اختیار کاربران قرار می‌گیرند.

Voice Transcribe 1.0 به‌زودی بازنشسته می‌شود

xAI قصد دارد Voice Transcribe 2.0 را به مدل پیش‌فرض Speech-to-Text API تبدیل کند. نسخه 1.0 نیز طبق اعلام این شرکت طی هفته‌های آینده از چرخه پشتیبانی خارج خواهد شد.

کاربرانی که در دوره انتقال همچنان به نسخه قدیمی نیاز داشته باشند، می‌توانند نام Voice Transcribe 1.0 را به‌صورت دستی در درخواست‌های API مشخص کنند. در حال حاضر مستندات xAI در صورت مشخص‌نشدن مدل، نسخه 1.0 را به‌عنوان مدل پیش‌فرض نشان می‌دهند؛ بااین‌حال نسخه 2.0 نیز از طریق رابط‌های REST و WebSocket قابل استفاده است.

جمع‌بندی

Voice Transcribe 2.0 تلاش xAI برای رقابت جدی‌تر در بازار تبدیل گفتار به متن است؛ مدلی که تمرکز آن تنها روی رونویسی عمومی نیست و سناریوهایی مانند تماس‌های پشتیبانی، فرمان‌های صوتی کوتاه، مکالمات چندزبانه و محیط‌های پرنویز را نیز هدف قرار می‌دهد. کاهش اعلام‌شده نرخ خطای کلمه در آزمایش فرمان‌های صوتی ۱۹ زبانه، یکی از مهم‌ترین نتایج منتشرشده درباره این مدل است.

نوشته گراک Voice Transcribe ۲.۰ معرفی شد؛ دقت تبدیل گفتار به متن بهبود یافت اولین بار در آی‌ تی‌ رسان منتشر شد.