ChatGPT научился одновременно говорить и слушать: OpenAI представила голосовую модель GPT-Live
OpenAI представила новую голосовую модель GPT-Live, которая позволяет ChatGPT одновременно воспринимать речь и формировать ответ, делая общение более естественным. В отличие от предыдущих версий, система больше не ждет полного окончания фразы, а способна вставлять короткие реплики, перебивать и выдерживать паузы.
Полнодуплексная архитектура модели обеспечивает непрерывную обработку входящего звука, самостоятельно определяя моменты для ответа или продолжения слушания. Это делает диалог похожим на обычный разговор между людьми. Кроме того, GPT-Live может выполнять сложные задачи в фоновом режиме, например, искать информацию в интернете или обращаться к другим моделям OpenAI, не прерывая беседу. При необходимости на экране появляются дополнительные карточки с картами, графиками или прогнозом погоды.
Новая технология уже внедряется в ChatGPT. Полная версия GPT-Live-1 доступна подписчикам тарифов Go, Plus и Pro в веб-версии и приложениях для iOS и Android. Пользователи бесплатной версии получают облегченную версию GPT-Live-1 mini. OpenAI также планирует предоставить доступ к GPT-Live через API для разработчиков. Компания оптимизировала модель для ряда популярных языков, но предупреждает, что на некоторых языках речь может быть менее беглой или с акцентом.