گراک Voice Transcribe ۲.۰ معرفی شد؛ دقت تبدیل گفتار به متن بهبود یافت
شرکت xAI از مدل جدید هوش مصنوعی خود برای تبدیل گفتار به متن با نام Voice Transcribe 2.0 رونمایی کرد. این مدل با تمرکز بر پردازش مکالمات واقعی، صداهای پرنویز و محتوای چندزبانه توسعه یافته و طبق اعلام xAI، نسبت به نسل قبلی یعنی Grok Voice Transcribe 1.0 دقت بالاتری دارد.
با وجود ارتقای عملکرد، قیمت استفاده از این سرویس برای پردازش دستهای تغییری نکرده و همچنان هر ساعت پردازش صوت ۰٫۱۰ دلار هزینه دارد. نرخ استفاده از حالت بلادرنگ نیز ۰٫۲۰ دلار به ازای هر ساعت اعلام شده است.
Voice Transcribe 2.0 چگونه آموزش دیده است؟
مدل جدید بر پایه فناوری صوتی بهکاررفته در Grok Voice ساخته شده است. xAI میگوید این فناوری اکنون در روز برای دهها هزار تماس پشتیبانی مشتری مورد استفاده قرار میگیرد و در پروژههایی مانند رونویسی میلیونها ساعت محتوای ویدیویی و اجرای قابلیتهای صوتی در محصولات مختلف نیز به کار گرفته شده است.
دستیار صوتی Grok در خودروهای تسلا یکی از نمونههای استفاده از این فناوری محسوب میشود.
برای آموزش Voice Transcribe 2.0، مجموعهای از فایلهای صوتی واقعی در محیطهای گوناگون مورد استفاده قرار گرفته است. این دادهها علاوه بر چندزبانه بودن، شامل صداهای ضبطشده در شرایط پرنویز نیز بودهاند. xAI همچنین پس از آموزش اولیه، مراحل دیگری را برای بهینهسازی مدل و افزایش عملکرد آن در سناریوهای واقعی انجام داده است.
ادعای xAI درباره دقت Voice Transcribe 2.0
xAI اعلام کرده است که Voice Transcribe 2.0 در میان ۳۲ مدل استریمینگ موجود در جدول عمومی Artificial Analysis، بالاترین دقت را به دست آورده است.
این شرکت برای ارزیابی عملکرد مدل تنها به بنچمارکهای عمومی اکتفا نکرده و آن را روی چهار مجموعه آزمایشی داخلی نیز بررسی کرده است. این دادهها از ترافیک واقعی به دست آمدهاند و مواردی مانند تماسهای پشتیبانی تلفنی، مکالمات کاربران با Grok، اطلاعات حساب و ایمیل و فرمانهای صوتی کوتاه به زبانهای مختلف را شامل میشوند.
طبق نتایج منتشرشده از سوی xAI، Voice Transcribe 2.0 در هر چهار آزمایش عملکرد بهتری نسبت به نسل قبلی داشته است. در آزمایش مربوط به تماسهای پشتیبانی انگلیسی با کیفیت ۸ کیلوهرتز نیز xAI اعلام کرده مدل جدید در مقایسه با سایر مدلهای بررسیشده عملکرد بهتری داشته است.

xAI برای مقایسه عملکرد مدل خود، نمونههایی مانند Gemini 3.5 Transcribe، MAI-Transcribe-2، ElevenLabs Scribe v2، Deepgram Nova-3 و Whisper Large v3 را نیز در نمودارهای آزمایشی خود قرار داده است.
کاهش چشمگیر خطای رونویسی در چند زبان
یکی از بخشهایی که xAI روی آن تأکید ویژهای دارد، بهبود عملکرد Voice Transcribe 2.0 در تشخیص گفتار چندزبانه است. این مدل میتواند زبان صحبتکردن را بهصورت خودکار تشخیص دهد و در صورت تغییر زبان در میانه فایل صوتی، بدون آنکه فایل به بخشهای جداگانه تقسیم شود، فرایند رونویسی را ادامه دهد.
این قابلیت در تشخیص فرمانهای کوتاه صوتی اهمیت بیشتری دارد؛ زیرا در چنین شرایطی مدل اطلاعات متنی و زمینه محدودی برای شناسایی زبان در اختیار دارد.
در یکی از آزمایشهای xAI، عملکرد مدل روی فرمانهای صوتی دستیار هوشمند در ۱۹ زبان بررسی شده است. بر اساس نتایج اعلامشده، نرخ خطای کلمه یا WER در این آزمایش از ۲۰٫۶ درصد در نسل قبلی به ۶٫۸ درصد در Voice Transcribe 2.0 رسیده است.
امکانات Speech-to-Text API گراک
Voice Transcribe 2.0 از طریق Speech-to-Text API در اختیار توسعهدهندگان قرار گرفته و امکان تبدیل فایلهای صوتی و URLها به متن را بهصورت دستهای یا بلادرنگ فراهم میکند.
از جمله قابلیتهای این API میتوان به موارد زیر اشاره کرد:
- ارائه زمان دقیق هر کلمه به همراه امتیاز اطمینان
- شناسایی و تفکیک گویندگان بدون دریافت هزینه اضافی
- پشتیبانی از رونویسی چندکاناله تا هشت کانال
- امکان تعریف حداکثر ۱۰۰ عبارت تخصصی برای افزایش دقت تشخیص کلمات کلیدی
- قالببندی خودکار اعداد، تاریخ، ارز، شماره تلفن و ایمیل
- حذف کلمات پرکننده از متن نهایی
- تشخیص خودکار پایان صحبت برای استفاده در عاملهای صوتی
یکی از نکات مهم برای توسعهدهندگان این است که سرویسهایی که پیشتر به Speech-to-Text API متصل شدهاند، میتوانند از بهبودهای مدل جدید استفاده کنند و طبق اعلام xAI نیازی به تغییر کد نخواهند داشت.
پشتیبانی از ۱۲ فرمت صوتی و فایلهای ۵۰۰ مگابایتی
مستندات API نشان میدهد Voice Transcribe 2.0 از ۱۲ فرمت صوتی پشتیبانی میکند و حداکثر حجم فایل قابل پردازش در آن ۵۰۰ مگابایت است.
این سرویس همچنین از نرخهای نمونهبرداری ۸۰۰۰، ۱۶۰۰۰، ۲۲۰۵۰، ۲۴۰۰۰، ۴۴۱۰۰ و ۴۸۰۰۰ هرتز پشتیبانی میکند.
از نظر زبان نیز پارامتر زبان API امکان قالببندی خروجی را در ۲۵ زبان فراهم میکند. انگلیسی، اسپانیایی، فرانسوی، آلمانی، هندی، ژاپنی و کرهای از جمله زبانهای پشتیبانیشده هستند.
قیمت Voice Transcribe 2.0
xAI قیمت مدل جدید را نسبت به Voice Transcribe 1.0 تغییر نداده است. هزینه استفاده از این سرویس بر اساس نوع پردازش به شکل زیر تعیین میشود:
| نوع پردازش | قیمت به ازای هر ساعت صوت |
|---|---|
| پردازش دستهای (Batch) | ۰٫۱۰ دلار |
| پردازش بلادرنگ (Streaming) | ۰٫۲۰ دلار |
امکاناتی مانند تشخیص گوینده، تعیین زمان کلمات و استفاده از عبارتهای تخصصی نیز بدون هزینه جداگانه در اختیار کاربران قرار میگیرند.
Voice Transcribe 1.0 بهزودی بازنشسته میشود
xAI قصد دارد Voice Transcribe 2.0 را به مدل پیشفرض Speech-to-Text API تبدیل کند. نسخه 1.0 نیز طبق اعلام این شرکت طی هفتههای آینده از چرخه پشتیبانی خارج خواهد شد.
کاربرانی که در دوره انتقال همچنان به نسخه قدیمی نیاز داشته باشند، میتوانند نام Voice Transcribe 1.0 را بهصورت دستی در درخواستهای API مشخص کنند. در حال حاضر مستندات xAI در صورت مشخصنشدن مدل، نسخه 1.0 را بهعنوان مدل پیشفرض نشان میدهند؛ بااینحال نسخه 2.0 نیز از طریق رابطهای REST و WebSocket قابل استفاده است.
جمعبندی
Voice Transcribe 2.0 تلاش xAI برای رقابت جدیتر در بازار تبدیل گفتار به متن است؛ مدلی که تمرکز آن تنها روی رونویسی عمومی نیست و سناریوهایی مانند تماسهای پشتیبانی، فرمانهای صوتی کوتاه، مکالمات چندزبانه و محیطهای پرنویز را نیز هدف قرار میدهد. کاهش اعلامشده نرخ خطای کلمه در آزمایش فرمانهای صوتی ۱۹ زبانه، یکی از مهمترین نتایج منتشرشده درباره این مدل است.
نوشته گراک Voice Transcribe ۲.۰ معرفی شد؛ دقت تبدیل گفتار به متن بهبود یافت اولین بار در آی تی رسان منتشر شد.
