Новость

Microsoft представила новые голосовые ИИ-модели в предварительном доступе

Новые MAI-модели Microsoft распознают и озвучивают речь. Есть русские голоса, но Foundry остаётся public preview без SLA; доступность из России отдельно не подтверждена.

Проверено по источникам 2 мин на чтение
Микрофон и ноутбук Microsoft Surface в редакционной студии записи

Коротко

Microsoft представила MAI-Transcribe-2-Streaming для распознавания речи в реальном времени и две модели синтеза: MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Их можно тестировать через Microsoft Foundry и MAI Playground. В Foundry это предварительный доступ без SLA, который Microsoft не рекомендует для производственных нагрузок. Доступность из России отдельно не подтверждена.

Все разделы
  1. Как работает потоковое распознавание
  2. Какие языки доступны для синтеза речи
  3. Что означает предварительный доступ

Как работает потоковое распознавание

Запись речи через настольный микрофон рядом с ноутбуком
Сгенерированная редакционная сцена записи звука. Интерфейс MAI и результат распознавания не показаны.

В анонсе от 1 октября Microsoft сообщает о поддержке 60 языков и непрерывном автоматическом определении языка. MAI-Transcribe-2-Streaming принимает поток звука и возвращает текст, пока человек ещё говорит.

Первые результаты являются промежуточными: новые слова и контекст могут изменить распознанную фразу. Затем модель подтверждает итоговый фрагмент. Это различие важно для субтитров, диктовки и голосовых команд. Необратимое действие по ещё меняющемуся тексту потребует отдельного подтверждения в приложении. Если до модели вообще не доходит звук, начните с проверки микрофона в Windows 11.

Какие языки доступны для синтеза речи

Прослушивание речи в наушниках за ноутбуком Microsoft Surface
Сгенерированная сцена прослушивания. Язык и качество голоса проверяют на собственных примерах.

MAI-Voice-2.1 и вариант Flash озвучивают текст. Для обеих моделей заявлены 23 языка и 26 локалей. Это два разных числа: локаль уточняет вариант языка, поэтому число локалей может быть больше. Flash ориентирован на сценарии, чувствительные к задержкам и большому объёму запросов.

В официальном перечне голосов присутствует русский язык ru-RU для обеих моделей. Проверять стоит произношение нужных имён, чисел и терминов на собственных примерах. Наличие русских голосов само по себе не подтверждает возможность регистрации или оплаты сервиса из России. Клонирование голоса сопровождается средствами проверки согласия.

Что означает предварительный доступ

Проверка звукового тракта с микрофоном и аудиоинтерфейсом
Сгенерированная сцена аппаратного теста. Предварительный доступ MAI не означает готовности сервиса для производственной нагрузки.

Документация Microsoft Learn прямо указывает public preview, отсутствие соглашения об уровне обслуживания и рекомендацию не использовать функцию для производственных нагрузок. Демо Chatter в MAI Playground показывает совместную работу моделей, но не обещает готовый голосовой сервис для любого аккаунта.

Для пробного приложения полезно отдельно оценить распознавание в шуме, задержку ответа и поведение при изменении промежуточного текста. Связь между голосовым слоем и обработкой запроса разобрана также в материале о голосовых агентах GPT-Live-1. Условия доступа и использования у разных поставщиков следует проверять отдельно.

Новости и разборы