Нейросети больше не смогут врать незаметно: израильские ученые нашли способ ловить ИИ на «галлюцинациях»

Доктор Марон: новый метод позволяет контролировать достоверность ответов ИИ

Общество

Исследователи из Хайфского Техниона совместно с компанией NVIDIA разработали экономичный метод выявления «галлюцинаций» у больших языковых моделей, не требующий понимания их внутреннего устройства. В основе подхода — внешняя легкая нейросеть, обученная распознавать момент, когда ИИ начинает выдумывать факты.

Проблема «черного ящика» долгое время делала поведение моделей непредсказуемым: миллиарды параметров не позволяли ученым проследить логику ответов. Авторы новой работы пошли иным путем. Когда большая языковая модель генерирует очередное слово, исследователи снимают значения весов и сигналов с ее скрытых слоев. Для человека эти триллионы чисел — цифровой шум, но маленькая нейросеть быстро обучается видеть в этой геометрии признак сбоя: когда модель «галлюцинирует», внутренние активации выглядят иначе, чем при достоверном ответе. Так пользователи получают инструмент контроля и прогнозирования поведения ИИ. Руководитель группы доктор Хаггай Марон отметил, что этот опыт открывает двери для интеграции искусственного интеллекта в сложные и ответственные структуры. Разработанные алгоритмы диагностики позволяют вовремя заметить, когда нейросеть начинает отклоняться от заданной программы или выдумывать факты. Метод уже получил признание на ведущих конференциях по машинному обучению, а его последние результаты будут представлены на AAAI-2026 в Сингапуре. В перспективе подход может лечь в основу систем предупреждения и стандартов безопасности в медицине, образовании, науке и госрегулировании.

Добавьте mosregtoday.ru в избранное