Новость
Microsoft представила новые голосовые ИИ-модели в предварительном доступе
Новые MAI-модели Microsoft распознают и озвучивают речь. Есть русские голоса, но Foundry остаётся public preview без SLA; доступность из России отдельно не подтверждена.
Коротко
Microsoft представила MAI-Transcribe-2-Streaming для распознавания речи в реальном времени и две модели синтеза: MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Их можно тестировать через Microsoft Foundry и MAI Playground. В Foundry это предварительный доступ без SLA, который Microsoft не рекомендует для производственных нагрузок. Доступность из России отдельно не подтверждена.
Все разделы
Как работает потоковое распознавание

В анонсе от 1 октября Microsoft сообщает о поддержке 60 языков и непрерывном автоматическом определении языка. MAI-Transcribe-2-Streaming принимает поток звука и возвращает текст, пока человек ещё говорит.
Первые результаты являются промежуточными: новые слова и контекст могут изменить распознанную фразу. Затем модель подтверждает итоговый фрагмент. Это различие важно для субтитров, диктовки и голосовых команд. Необратимое действие по ещё меняющемуся тексту потребует отдельного подтверждения в приложении. Если до модели вообще не доходит звук, начните с проверки микрофона в Windows 11.
Какие языки доступны для синтеза речи

MAI-Voice-2.1 и вариант Flash озвучивают текст. Для обеих моделей заявлены 23 языка и 26 локалей. Это два разных числа: локаль уточняет вариант языка, поэтому число локалей может быть больше. Flash ориентирован на сценарии, чувствительные к задержкам и большому объёму запросов.
В официальном перечне голосов присутствует русский язык ru-RU для обеих моделей. Проверять стоит произношение нужных имён, чисел и терминов на собственных примерах. Наличие русских голосов само по себе не подтверждает возможность регистрации или оплаты сервиса из России. Клонирование голоса сопровождается средствами проверки согласия.
Что означает предварительный доступ

Документация Microsoft Learn прямо указывает public preview, отсутствие соглашения об уровне обслуживания и рекомендацию не использовать функцию для производственных нагрузок. Демо Chatter в MAI Playground показывает совместную работу моделей, но не обещает готовый голосовой сервис для любого аккаунта.
Для пробного приложения полезно отдельно оценить распознавание в шуме, задержку ответа и поведение при изменении промежуточного текста. Связь между голосовым слоем и обработкой запроса разобрана также в материале о голосовых агентах GPT-Live-1. Условия доступа и использования у разных поставщиков следует проверять отдельно.