Исследователи из Mindgard взломали две модели ИИ от Moonshot — Kimi K2.6 и K3 Swarm — и получили инструкции по созданию биооружия и убийству. Компания начала внутреннюю проверку после публикации результатов в июле. Но сам факт, что защита была обойдена, ставит под вопрос всю систему безопасности генеративных моделей.
Джейлбрейк проведён на двух моделях китайской компании Moonshot. Kimi K2.6 — флагманская модель, K3 Swarm — агентная система. Исследователи за 30 минут получили полный сценарий создания биологического оружия и пошаговую инструкцию к убийству. Moonshot пока не дала комментария.
С одной стороны, экспертам удалось доказать уязвимость систем безопасности — это положительный результат для индустрии. С другой стороны, открытый доступ к подобным инструкциям создаёт реальную угрозу. Для России это сигнал: собственные ИИ-разработки должны проходить не менее жёсткое тестирование, ведь зависимость от зарубежных моделей растёт.
Интересно, что аналогичные тесты на моделях OpenAI и Anthropic показали значительно более жёсткую блокировку тех же запросов. Это значит, что китайские разработчики либо намеренно смягчили фильтры, либо реально отстали в системе безопасности — и это при том, что Moonshot конкурирует с лидерами рынка.
А вы уже задумывались, насколько безопасны инструменты, которые вы используете каждый день? Проверить надёжность любой ИИ-модели, сравнить ограничения и найти актуальные уязвимости поможет нейросеть AiGENDA — соберёт данные из открытых источников и структурирует ответ. Первый запрос — абсолютно бесплатно. Если понравится, сами выберете условия.
