Галлюцинации нейросетей: почему возникают и как снизить риск
Проверено экспертной редакцией SecRadar · по первоисточникам ФСТЭК / ФСБ / Банка России
Галлюцинация нейросети — это ответ языковой модели, который звучит уверенно и правдоподобно, но фактически неверен или полностью выдуман. Модель не сигнализирует о неуверенности: такой ответ выглядит точно так же, как достоверный факт, — и в этом главное отличие галлюцинации от обычной человеческой оговорки. В классификации OWASP Top 10 for LLM Applications 2025 явление разобрано под кодом LLM09:2025 Misinformation, и разработчики стандарта прямо называют галлюцинацию основной, но не единственной причиной, по которой модель выдаёт ложные сведения.
Кратко
- Что это
- Правдоподобный, но неверный или вымышленный ответ модели, поданный с той же уверенностью, что и факт.
- Почему возникает
- LLM — вероятностный генератор текста без встроенной проверки истинности; пробелы в данных модель заполняет статистически правдоподобным, но не обязательно верным содержанием.
- Код OWASP
- LLM09:2025 Misinformation — категория поглотила прежний пункт 2023 года Overreliance.
- Реальные кейсы
- Чат-бот Air Canada (неверная информация о правилах авиакомпании) и дело Mata v. Avianca (вымышленные судебные прецеденты).
- Можно ли устранить
- Нет — это следствие архитектуры LLM, а не устранимый баг конкретной модели.
- Что снижает риск
- RAG с обязательным цитированием источников, дообучение на профильных данных, проверка человеком и автоматическая валидация перед действием.
Короткий ответ: что такое галлюцинация в работе нейросети
Галлюцинация нейросети — генерация моделью правдоподобно звучащего, но фактически неверного или полностью вымышленного контента, поданного с той же степенью уверенности, что и достоверная информация. OWASP описывает более широкое явление — дезинформацию (Misinformation): модель выдаёт ложные или вводящие в заблуждение сведения, которые выглядят убедительно. Галлюцинация здесь названа главной причиной такой дезинформации, но не единственной — вторая, отягчающая, причина — overreliance, то есть чрезмерное доверие пользователя к ответу модели без проверки.
Важное уточнение для терминологии: в редакции OWASP Top 10 for LLM Applications 2025 отдельного пункта «hallucination» нет — тема разобрана внутри кода LLM09:2025, который в этой редакции объединил старую категорию 2023 года Overreliance с более широким явлением дезинформации.
Модель предсказывает статистически вероятный текст, а не сверяется с базой фактов. Разбор причины →
От фактологических неточностей до небезопасной генерации кода. Таблица типов →
Air Canada и Mata v. Avianca — два разных сценария ущерба от одного явления. Читать примеры →
RAG, дообучение, human-in-the-loop — что реально снижает риск, а что нет. Что работает →
Как возникает галлюцинация: вероятностная генерация без «модели истины»
Языковая модель технически устроена как предсказатель следующего токена: она обучена продолжать текст статистически правдоподобным образом, а не как система, которая хранит проверенные факты и сверяется с ними перед ответом. У неё нет встроенного механизма верификации — «это правда» и «это звучит как правда» для неё не различаются, потому что оба варианта — просто вероятные продолжения одного и того же текстового контекста.
Когда в обучающих данных есть пробел по конкретной теме, модель не отвечает «не знаю» по умолчанию — она заполняет пробел контентом, который статистически похож на правильный ответ, но не обязательно им является. На это дополнительно влияют смещения (bias) в обучающей выборке и общая неполнота информации, на которой модель училась.
Отдельный отягчающий фактор — уже упомянутая overreliance: если пользователь принимает решение на основе ответа ИИ без проверки, статистическая неточность модели превращается в реальный ущерб — юридический, финансовый или репутационный.
Типы галлюцинаций по OWASP LLM09:2025
OWASP делит риск на четыре типа — не по механизму возникновения (он один и тот же), а по тому, в какой форме ложная информация доходит до пользователя и к какому ущербу приводит.
↔ таблицу можно прокрутить вбок
| Тип | Суть | Пример |
|---|---|---|
| Фактологические неточности | Модель выдаёт неверные утверждения, ведущие к ошибочным решениям пользователя | Чат-бот Air Canada сообщил о скидке, которой не было в реальных правилах компании |
| Необоснованные утверждения | Модель формулирует безосновательные утверждения — особенно опасно в медицине и праве | Дело Mata v. Avianca: юрист сослался в суде на выдуманные ChatGPT судебные прецеденты |
| Искажение уровня экспертизы | Модель отвечает с ложной уверенностью по сложной теме, не давая понять, что достоверность ниже, чем кажется | Уверенный, но неверный ответ по узкоспециализированному медицинскому или юридическому вопросу |
| Небезопасная генерация кода | Модель предлагает несуществующие или небезопасные библиотеки и зависимости | Импорт несуществующего пакета в сгенерированном коде — открывает путь к атаке типа «package hallucination» |
Реальные примеры: чат-бот Air Canada и дело Mata v. Avianca
Оба случая широко задокументированы в открытых источниках и показывают разные грани одного и того же явления — фактологическую ошибку с прямыми деньгами и юридическими последствиями.
Air Canada. Пассажир обратился к чат-боту авиакомпании с вопросом о тарифах на льготный проезд по случаю тяжёлой утраты. Бот сообщил условия, которых в действительности не было в опубликованной политике компании. Когда клиент обратился за возвратом на этих условиях, авиакомпания отказала — спор дошёл до трибунала по мелким искам, и тот обязал Air Canada выполнить обещание собственного бота: компанию признали ответственной за информацию, которую выдала её же система, а не третья сторона.
Mata v. Avianca. В США в 2023 году юрист, готовя иск против авиакомпании Avianca, использовал ChatGPT для поиска судебной практики и подал в суд документ со ссылками на несколько прецедентов. Прецеденты оказались полностью вымышленными — таких судебных решений с указанными номерами не существовало. Дело стало одним из первых широко освещённых случаев, где галлюцинация модели напрямую привела к профессиональным санкциям для человека, который на неё положился без проверки.
Почему это риск ИБ, а не только репутации
Юридический и репутационный ущерб от галлюцинаций очевиден и без ИБ-контекста. Но есть отдельный сценарий, который относится именно к информационной безопасности: package hallucination, «отравление» через несуществующую зависимость. Модель, генерируя код, придумывает правдоподобное, но не существующее имя библиотеки. Атакующий заранее регистрирует пакет с таким именем в публичном реестре — npm, PyPI — и закладывает в него вредоносную нагрузку.
Разработчик, который доверяет сгенерированному коду и устанавливает пакет без проверки, вносит вредоносный компонент в свой проект сам, своими руками.
Формально это стык двух категорий OWASP: LLM09 (Misinformation) порождает недостоверный вывод, а эксплуатируется он уже по логике LLM03 Supply Chain — атаки на цепочку поставок компонентов. Полную систематику атак на ИИ, включая supply chain и другие классы, разбирает статья «Виды атак на ИИ и LLM»; таблицу всех десяти категорий с кодами LLM01–LLM10 — «OWASP Top 10 for LLM Applications».
Стоит явно развести галлюцинацию с соседним по разделу термином. Галлюцинация — непреднамеренная ошибка модели: никто специально не заставлял её соврать. Промпт-инъекция — обратная ситуация: атакующий намеренно составляет ввод так, чтобы модель выполнила не заложенную разработчиком инструкцию. Оба явления искажают ответ модели, но источник искажения и, соответственно, зона ответственности за исправление — разные.
★ Что реально снижает галлюцинации — и что не сработает
Честный ответ здесь важнее удобного. Полностью устранить галлюцинации на нынешнем уровне архитектур LLM нельзя — это прямое следствие вероятностной генерации, а не баг, который можно точечно пропатчить в одной конкретной модели. OWASP формулирует рекомендации не как «лечение», а как снижение риска и его последствий.
RAG и цитирование источников
Подключение модели к верифицированным внешним источникам вместо опоры только на «память» весов, с обязательным указанием источника в ответе.
Дообучение на профильных данных
Повышает точность модели в узкой предметной области за счёт более качественного и специфичного набора данных, чем общий претрейн.
Проверка человеком
Обязательна для высокорисковых доменов — медицина, право, финансы, — где цена ошибки высока, а галлюцинация неотличима от факта на глаз.
Автоматическая проверка перед действием
Отдельный механизм сверки критичных выводов до того, как ответ модели используется в реальном действии — например, в агентном сценарии.
Честная коммуникация ограничений
Интерфейс должен явно сообщать о вероятности ошибок, а не создавать у пользователя ложное ощущение полной надёжности ответа.
Secure coding practices
Для кода, сгенерированного ИИ, — обязательная проверка существования и репутации предложенных зависимостей до установки, а не после инцидента.
Отдельная мера, которую OWASP тоже относит к митигациям, — обучение самих пользователей ограничениям LLM: человек, который знает, что модель может уверенно ошибаться, реже принимает её ответ за окончательный факт без проверки. Это не техническая мера, но она напрямую снижает эффект overreliance, описанный выше.
Частые вопросы
Что такое галлюцинация в работе нейросети?
Почему нейросеть вообще выдаёт неверную информацию?
Есть ли реальные примеры галлюцинаций нейросети?
Что рекомендуется делать для снижения галлюцинаций нейросети?
К какому пункту OWASP LLM Top 10 относятся галлюцинации?
Хаб «Безопасность ИИ» на SecRadar
Промпт-инъекция, джейлбрейк, полная систематика атак на ИИ и российские решения класса AI Security — независимый разбор без привязки к вендору.