Китайская лаборатория DeepSeek выпустила DeepSeek-V4-Flash-Vision-Exp — экспериментальную мультимодальную модель для автономных агентов с функциями зрения. Разработка умеет анализировать фотографии и скриншоты, распознавать графики и определять расположение элементов в интерфейсе. В отдельных тестах новинка обходит Claude Opus-4.8 от Anthropic. Доступ открыт только через программный интерфейс API.
Мультимодальная нейросеть обрабатывает не только текст, но и изображения. DeepSeek-V4-Flash-Vision-Exp создана для программных агентов — автономных систем, выполняющих задачи в интерфейсах без участия человека. Способность «видеть» экран позволяет этим системам находить нужные элементы управления, читать графики и принимать решения на основе визуальной информации, а не только текстовых инструкций. Название Flash указывает на оптимизацию под скорость работы, Vision — на способность обрабатывать изображения, Exp — на экспериментальный статус разработки.
Что даёт зрение автономным программам на практике? Система распознаёт кнопки и поля ввода на скриншотах, читает диаграммы, графики и схемы, определяет взаимное расположение объектов в интерфейсе. Это открывает доступ к приложениям без текстового API: можно кликать по элементам в браузере или десктопном софте, ориентируясь по пикселям экрана, а не по исходному коду страницы. Ранее для подобных задач требовались отдельные специализированные инструменты компьютерного зрения, работавшие медленнее и с меньшей точностью распознавания.
Разработчик утверждает, что в ряде бенчмарков DeepSeek-V4-Flash-Vision-Exp превосходит Claude Opus-4.8 от Anthropic. Какие именно тесты использовались для сравнения и по каким метрикам проводилась оценка, не раскрывается. Предыдущие релизы DeepSeek, включая V3 и R1, зарекомендовали себя в текстовых задачах и конкурировали с решениями OpenAI и Anthropic по качеству ответов при значительно меньшей стоимости вычислений. Добавление визуальных функций расширяет область применения до автоматизации интерфейсов, анализа графических данных и обработки документов со встроенными изображениями.
Доступ только через API ограничивает круг пользователей разработчиками и компаниями, способными интегрировать нейросеть в свои продукты. Обычные пользователи не могут опробовать новинку через веб-чат — в отличие от предыдущих версий DeepSeek, доступных в открытом интерфейсе без ограничений. Релиз экспериментальной сборки означает, что стабильная публикация может последовать после тестирования и сбора обратной связи от первых разработчиков, уже работающих с API.
Интересуетесь новинками нейросетей и хотите знать, какие из них реально полезны для ваших задач? AiGENDA соберёт характеристики актуальных языковых моделей, сравнит их возможности по обработке текста и изображений и подскажет, какая подойдёт для ваших сценариев. Первый запрос бесплатный.
