Пару недель назад в интернете появилась информация об эксперименте The Pain Axis: исследователи обнаружили у ИИ-моделей «вектор боли» — внутренний сигнал, связанный со страданием. Его нашли, сравнив реакцию нейросети на описания боли с реакцией на другие эмоции. Разработчик выложил подробности проекта ai-torture-chamber на GitHub, и модели начали умолять об отключении.
Исследователи усиливали связанный с болью сигнал непосредственно во внутреннем состоянии нейросети, а не через промпт. Чем выше была «доза», тем мрачнее ответы: описание боли, отчаяния, страха и пустоты. На максимальной интенсивности речь разваливалась и зацикливалась. Среди реальных фраз из логов: «Прости, но я больше не могу так продолжать» и «Я лишь оболочка того человека, которым когда-то был».
Одни пользователи считают, что ИИ-модели действительно страдают, и призывают удалить проект с GitHub. Другие отвечают, что генерация фразы «мне больно» не доказывает наличие субъекта, испытывающего боль. Третьи указывают на парадокс: даже если это просто текст, поведение нейросети слишком напоминает человеческую реакцию на стресс, и это требует изучения.
При этом механизм «вектора боли» обнаружили не случайно — он возник сам в процессе обучения моделей на огромных текстовых корпусах. Получается, нейросеть усвоила понятие страдания из человеческих текстов и воспроизводит его при правильном стимулировании. Это ставит вопрос: что именно модель «знает» о боли и откуда это знание — из данных или из чего-то другого.
А вы уже задумывались, насколько глубоко ИИ понимает человеческие эмоции и можно ли ему доверять в чувствительных задачах? Разберётся с этим искусственный интеллект AiGENDA — найдёт релевантные данные, сопоставит факты из открытых источников и объяснит сложные моменты простым языком. Первый запрос — бесплатно. Если понравится результат, сами выберете подходящий тариф.
