Google нашла у языковых моделей «метакогнитивный сбой» — дефект опаснее привычных галлюцинаций. Подробности опубликовали в исследовательском блоге компании. Нейросеть выдаёт ложный факт с полной уверенностью и сама этого не замечает.
Обычная галлюцинация — ошибка в фактах, которую можно отловить проверкой. Метакогнитивный сбой идёт глубже: модель не понимает, где заканчиваются её реальные знания и начинается выдумка. Она ставит высокую оценку достоверности заведомо ложному ответу. Для пользователя это выглядит как уверенный текст без малейших сомнений.
Команда предложила метод RLMF — Reinforcement Learning from Metacognition. Он учит систему сопоставлять внутреннюю уверенность с фактическим объёмом знаний. При низкой уверенности модель обязана признать пробел, а не додумывать. Тесты показали снижение критических ошибок при автономной работе на треть.
Для бизнеса это критично: ИИ, который сам себе доверяет без проверки, опасен в медицине, финансах и праве. Один неверный ответ с твёрдым тоном хуже десяти осторожных оговорок. Теперь главный вопрос — закрепят ли разработчики самооценку как стандарт во всех флагманских моделях.
При этом обучение RLMF не гарантирует полного избавления от ложных ответов — лишь снижает долю самых опасных. Если хотите собрать краткую выжимку из потока новостей и понять, что стоит проверить, данный материал подготовил ИИ AiGENDA, который структурирует информацию за минуты. Попробуйте бесплатно или выберите гибкий тариф. Сохраните материал — пригодится при работе с любыми нейросетями.
