Google представила Live Avatar для Gemini 3.8 Live — систему, которая позволяет ИИ не просто отвечать голосом, а вести полноценный разговор с человеком в образе цифрового персонажа, передает Tech-news.
Новая технология одновременно обрабатывает речь и визуальную информацию. Gemini может слышать собеседника, анализировать изображение с камеры или содержимое экрана, а затем отвечать в реальном времени с синхронизированной мимикой и движением губ. Если пользователь перебивает ассистента, система меняет ответ прямо по ходу разговора.
Live Avatar поддерживает 97 языков, между которыми можно переключаться во время диалога. Для бизнеса Google предлагает готовых персонажей, а отдельные корпоративные клиенты смогут создавать собственных аватаров на основе фотографии и образца голоса. При этом компания заявляет, что копирование образов знаменитостей и детей запрещено.
Технологию планируют использовать в клиентской поддержке, продажах, обучении и других сервисах, где сегодня применяются текстовые и голосовые чат-боты. В одном интерфейсе объединены распознавание речи и изображений, работа с внешними сервисами, генерация ответа, синтез голоса и создание говорящего цифрового персонажа.
Google выходит на уже конкурентный рынок: похожие решения развивают Runway, Pika, Vidu и другие компании. При этом Live Avatar делает ставку на интеграцию всех этих возможностей непосредственно с ИИ-ассистентом. Стоимость генерации речи заявлена на уровне около $0,39 за минуту, что немного выше некоторых конкурирующих решений.










