Meta запускає Muse Voice Transcribe: транскрибація мовлення в реальному часі за $0,18 за годину
Meta представила Muse Voice Transcribe — модель розпізнавання мовлення, що працює в реальному часі, підтримує розділення мовців для понад 20 учасників і коштує $0,18 за годину аудіо через публічний API. Рішення конкурує з Speechmatics та Amazon Transcribe.
Meta виходить на ринок транскрибації мовлення в реальному часі з новою моделлю Muse Voice Transcribe, яка поєднує потокове розпізнавання, визначення меж висловлювань і розділення мовців для понад 20 учасників. Публічна ціна API становить лише $0,18 за годину обробленого аудіо, що робить пропозицію агресивною для корпоративних розробників.
Модель, створена Meta Superintelligence Labs, обробляє мовлення безпосередньо під час його звучання, а не після завершення запису. За даними компанії, Muse підтримує аудіо тривалістю понад годину, багатомовне перемикання кодів, коригування за мовою та ключовими словами, а також діаризацію без окремого етапу постобробки. Навчання моделі відбувалося на матеріалах понад 70 мов, з яких 25 ретельно перевірені для першого релізу.
Заявлена підтримка понад 20 мовців є значною, але не світовим рекордом. Згідно з документацією конкурентів, сервіс реального часу Speechmatics визначає 50 мовців за замовчуванням і до 100 після збільшення ліміту, тоді як Amazon Transcribe підтримує до 30 унікальних мовців, зокрема в потоковій транскрибації. Водночас Muse опиняється у верхній частині ринку за цим показником.
Ключова перевага Meta полягає не в рекордній кількості мовців, а в поєднанні високопродуктивної діаризації з низькою затримкою транскрибації, визначенням меж реплік, багатомовним перемиканням і конкурентною ціною в одній моделі. Для розробників, які створюють системи нарад, аналітику дзвінків, живі асистенти або ambient AI, така комбінація може бути важливішою за рекордні показники окремих конкурентів.
Діаризація стає невіддільною частиною базового стеку голосових технологій. Традиційне розпізнавання мовлення відповідає на питання, що було сказано, тоді як діаризація додає відповідь на питання, хто це сказав. Ця відмінність критична, коли транскрипти передаються в подальші AI-системи. Асистент нарад може правильно транскрибувати кожне речення, але створити недостовірний корпоративний запис, якщо припише схвалення, зобов’язання чи заперечення не тому учаснику. Та сама проблема стосується аналітики обслуговування клієнтів, комплаєнс-процесів та AI-агентів, що працюють у приміщеннях, де говорять кілька людей.
Muse вбудовує атрибуцію мовців безпосередньо в свою авторегресивну мультимодальну архітектуру. Аудіо надходить фрагментами по 80 мілісекунд, тобто 12,5 фрагментів на секунду, кожен із яких перетворюється на м’який токен. На кожному кроці модель вирішує, чи споживати більше аудіо, чи видавати текст. Meta називає цей механізм адаптивною затримкою: замість єдиного бюджету затримки для кожного слова Muse може чекати довше, коли мовлення неоднозначне, і видавати результат раніше, коли контексту достатньо. Навчання цієї поведінки відбувається через навчання з підкріпленням, що поєднує винагороди за рівень помилок у словах і затримку.
Атрибуція мовців та визначення меж реплік стають частиною тієї самої послідовності токенів. Токен <|start_of_turn|> позначає потенційний новий хід мовця, токени на кшталт <|speaker_A|> ідентифікують мовця, а окремі токени початку та кінця визначають межі висловлювання. Meta навчає розпізнавання мовлення, діаризацію та визначення меж реплік разом, а не запускає кластеризацію мовців як окремий постпроцес. Документація Model API для перетворення мовлення на текст також представляє діаризацію як повноцінний режим роботи поряд із push-to-talk та визначенням меж. Мітки мовців, як-от A і B, діють у межах сесії, а не є підтвердженими особами, а API надає часові позначки на рівні реплік, а не окремих слів.
Порівняння кількості мовців потребує обережності, оскільки постачальники реалізують діаризацію по-різному й не всі публікують максимальні значення. Найсильнішу явну заявку в реальному часі має Speechmatics: 50 мовців за замовчуванням із можливістю збільшення до 100. AWS також перевищує показник Meta: Amazon Transcribe розрізняє до 30 унікальних мовців. Soniox підтримує діаризацію в реальному часі та асинхронно, але документує максимум 15 мовців на сесію, а AssemblyAI дозволяє встановлювати від одного до десяти мовців. Обидві компанії застерігають, що атрибуція мовців у реальному часі складніша, оскільки потокові системи ухвалюють рішення з меншим контекстом майбутнього аудіо, ніж офлайн-моделі. xAI також підтримує діаризацію в потоковому режимі, але не публікує максимальну кількість мовців.
Таким чином, опис можливостей Muse як нового світового рекорду був би неточним. Найвищий задокументований показник реального часу серед розглянутих систем — конфігурована стеля Speechmatics у 100 мовців. Meta також не демонструє понад 20 одночасних учасників у своїх матеріалах запуску: основна жива демонстрація використовує вісім мовців, а довгий запис містить 11 позначених учасників. Показник понад 20 є заявленою можливістю моделі, а не кількістю учасників у публічних демонстраціях.



