Новость

GPT-Live-1 вышла в API: голосовые агенты без пауз

OpenAI выпустила GPT-Live-1 в API. Модель умеет слушать и говорить одновременно, обрабатывать перебивания и передавать сложные задачи другому AI-агенту.

Редакция Failx.ru 2 мин на чтение
Обложка материала: GPT-Live-1 вышла в API: голосовые агенты без пауз
В материале
  1. Чем полезен full-duplex
  2. Как подключается модель
  3. Делегирование и цена
  4. Что проверить перед production

Коротко: GPT-Live-1 даёт разработчикам full-duplex голосовой слой, который слышит пользователя во время собственного ответа и может естественно реагировать на перебивание. Сложное рассуждение и инструменты делегируются выбранной бэкенд-модели. Доступность API можно проверить на странице OpenAI API.

В классической схеме речь отдельно распознаётся, затем обрабатывается текстовой моделью и снова синтезируется. Каждый переход добавляет задержку. GPT-Live-1 объединяет входящий и исходящий звук, при этом сохраняет транскрипт и текст ответа для журнала и интеграции.

Чем полезен full-duplex

Согласно анонсу OpenAI, модель лучше обрабатывает паузы, короткие подтверждения и смену вопроса в середине ответа. Для поддержки это означает меньше механических остановок и более естественный разговор, но критические данные всё равно следует подтверждать отдельно.

Две звуковые волны одновременно работают в голосовом AI-интерфейсе
Full-duplex позволяет пользователю естественно перебить голосовой ответ.

Как подключается модель

Для браузерных приложений подходит WebRTC, для серверных интеграций доступен WebSocket, также заявлена телефония. GPT-Live-1 поддерживает определение очереди реплик, подсказки для ключевых слов и текстовые транскрипты. Архитектуру нужно выбирать с учётом задержки, записи звонков и требований к персональным данным.

Микрофон, браузер, сервер и телефон подключены к голосовому API
WebRTC, WebSocket и телефония покрывают разные сценарии подключения.

Делегирование и цена

Голосовой слой может продолжать диалог, пока другая модель ищет информацию или вызывает инструменты. OpenAI указала цену 0,05 доллара за минуту только для фронтенд-слоя. Токены бэкенд-модели и внешние инструменты оплачиваются отдельно, поэтому стоимость следует считать на полном сценарии.

Голосовой интерфейс передаёт сложную задачу серверной AI-модели
Голос остаётся отзывчивым, пока бэкенд-модель выполняет сложную работу.

Что проверить перед production

Проверьте разговор в шуме, длинные паузы, двойную речь, произношение имён, отказ сети и повторное подключение. Сообщите пользователю о записи и обработке аудио, если она ведётся. Для задач с действиями добавьте явное подтверждение. Агентную часть можно построить через OpenAI Agents API.

Новости и разборы