Модель Griffin от Tavus прошла тест Тьюринга по видеосвязи, одновременно видя, слыша, говоря и реагируя на действия собеседника[1]. В первой демо виртуальная девушка Ванесса помогла человеку собрать настоящий кубик Рубика в реальном времени, отслеживая его руки через камеру. На бенчмарке NVIDIA VideoFDB модель заняла первое место в двух категориях — генерации и восприятию видео[1]. Наконец-то ИИ-агент готов появляться на созвонах вместо нас.
Griffin объединяет зрение, аудио, речь и реакцию в одном pipeline. В демо Vanessa направляла человеческие руки к нужным граням кубика, адаптируясь к движениям в реальном времени. Tavus позиционирует продукт для бизнес-звонков, где агент замещает человека[1].
Результат на NVIDIA VideoFDB показал доминирование в двух направлениях одновременно — редкий случай для одной модели. Для отрасли это сигнал: мультимодальные агенты переходят из лабораторий в рабочие инструменты. Для пользователя — новый уровень автоматизации созвонов, где виртуальный собеседник видит, слышит и действует.
Скрытая деталь из исходника: в первой демке использовался настоящий физический кубик и реальные руки, а не симулятор. Значит, задержки и ошибки нейросети видны без масок — тест живой, а не заученный.
Если хотите разобраться, как мультимодальные агенты меняют рабочие процессы и где ими удобнее пользоваться, сравнить варианты поможет нейросеть AiGENDA. Первый запрос — бесплатно. Если пригодится, сами выберете тариф.
Материал подготовлен по информации из открытых источников:
1. https://t.me/aigendalive/42705
