SecRadar / Безопасность ИИ / Галлюцинации нейросетей
OWASP LLM09:2025 · Misinformation

Галлюцинации нейросетей: почему возникают и как снизить риск

Проверено экспертной редакцией SecRadar · по первоисточникам ФСТЭК / ФСБ / Банка России

Галлюцинация нейросети — это ответ языковой модели, который звучит уверенно и правдоподобно, но фактически неверен или полностью выдуман. Модель не сигнализирует о неуверенности: такой ответ выглядит точно так же, как достоверный факт, — и в этом главное отличие галлюцинации от обычной человеческой оговорки. В классификации OWASP Top 10 for LLM Applications 2025 явление разобрано под кодом LLM09:2025 Misinformation, и разработчики стандарта прямо называют галлюцинацию основной, но не единственной причиной, по которой модель выдаёт ложные сведения.

Экспертная редакция SecRadar · как мы проверяем факты → Обновлено 10 июля 2026 · ~9 мин чтения сверено по genai.owasp.org/llmrisk/llm092025-misinformation

Кратко

Что это
Правдоподобный, но неверный или вымышленный ответ модели, поданный с той же уверенностью, что и факт.
Почему возникает
LLM — вероятностный генератор текста без встроенной проверки истинности; пробелы в данных модель заполняет статистически правдоподобным, но не обязательно верным содержанием.
Код OWASP
LLM09:2025 Misinformation — категория поглотила прежний пункт 2023 года Overreliance.
Реальные кейсы
Чат-бот Air Canada (неверная информация о правилах авиакомпании) и дело Mata v. Avianca (вымышленные судебные прецеденты).
Можно ли устранить
Нет — это следствие архитектуры LLM, а не устранимый баг конкретной модели.
Что снижает риск
RAG с обязательным цитированием источников, дообучение на профильных данных, проверка человеком и автоматическая валидация перед действием.

Короткий ответ: что такое галлюцинация в работе нейросети

Галлюцинация нейросети — генерация моделью правдоподобно звучащего, но фактически неверного или полностью вымышленного контента, поданного с той же степенью уверенности, что и достоверная информация. OWASP описывает более широкое явление — дезинформацию (Misinformation): модель выдаёт ложные или вводящие в заблуждение сведения, которые выглядят убедительно. Галлюцинация здесь названа главной причиной такой дезинформации, но не единственной — вторая, отягчающая, причина — overreliance, то есть чрезмерное доверие пользователя к ответу модели без проверки.

Важное уточнение для терминологии: в редакции OWASP Top 10 for LLM Applications 2025 отдельного пункта «hallucination» нет — тема разобрана внутри кода LLM09:2025, который в этой редакции объединил старую категорию 2023 года Overreliance с более широким явлением дезинформации.

Механизм

Модель предсказывает статистически вероятный текст, а не сверяется с базой фактов. Разбор причины →

4 типа по OWASP

От фактологических неточностей до небезопасной генерации кода. Таблица типов →

Кейсы

Air Canada и Mata v. Avianca — два разных сценария ущерба от одного явления. Читать примеры →

Митигации

RAG, дообучение, human-in-the-loop — что реально снижает риск, а что нет. Что работает →

Как возникает галлюцинация: вероятностная генерация без «модели истины»

Языковая модель технически устроена как предсказатель следующего токена: она обучена продолжать текст статистически правдоподобным образом, а не как система, которая хранит проверенные факты и сверяется с ними перед ответом. У неё нет встроенного механизма верификации — «это правда» и «это звучит как правда» для неё не различаются, потому что оба варианта — просто вероятные продолжения одного и того же текстового контекста.

Когда в обучающих данных есть пробел по конкретной теме, модель не отвечает «не знаю» по умолчанию — она заполняет пробел контентом, который статистически похож на правильный ответ, но не обязательно им является. На это дополнительно влияют смещения (bias) в обучающей выборке и общая неполнота информации, на которой модель училась.

Отдельный отягчающий фактор — уже упомянутая overreliance: если пользователь принимает решение на основе ответа ИИ без проверки, статистическая неточность модели превращается в реальный ущерб — юридический, финансовый или репутационный.

факт механизм и роль overreliance — по genai.owasp.org/llmrisk/llm092025-misinformation

Типы галлюцинаций по OWASP LLM09:2025

OWASP делит риск на четыре типа — не по механизму возникновения (он один и тот же), а по тому, в какой форме ложная информация доходит до пользователя и к какому ущербу приводит.

↔ таблицу можно прокрутить вбок

ТипСутьПример
Фактологические неточностиМодель выдаёт неверные утверждения, ведущие к ошибочным решениям пользователяЧат-бот Air Canada сообщил о скидке, которой не было в реальных правилах компании
Необоснованные утвержденияМодель формулирует безосновательные утверждения — особенно опасно в медицине и правеДело Mata v. Avianca: юрист сослался в суде на выдуманные ChatGPT судебные прецеденты
Искажение уровня экспертизыМодель отвечает с ложной уверенностью по сложной теме, не давая понять, что достоверность ниже, чем кажетсяУверенный, но неверный ответ по узкоспециализированному медицинскому или юридическому вопросу
Небезопасная генерация кодаМодель предлагает несуществующие или небезопасные библиотеки и зависимостиИмпорт несуществующего пакета в сгенерированном коде — открывает путь к атаке типа «package hallucination»
факт 4 типа риска — genai.owasp.org/llmrisk/llm092025-misinformation оценка названия кейсов Air Canada и Mata v. Avianca переданы как иллюстрации со страницы OWASP, дословную формулировку стоит сверять по первоисточнику

Реальные примеры: чат-бот Air Canada и дело Mata v. Avianca

Оба случая широко задокументированы в открытых источниках и показывают разные грани одного и того же явления — фактологическую ошибку с прямыми деньгами и юридическими последствиями.

Air Canada. Пассажир обратился к чат-боту авиакомпании с вопросом о тарифах на льготный проезд по случаю тяжёлой утраты. Бот сообщил условия, которых в действительности не было в опубликованной политике компании. Когда клиент обратился за возвратом на этих условиях, авиакомпания отказала — спор дошёл до трибунала по мелким искам, и тот обязал Air Canada выполнить обещание собственного бота: компанию признали ответственной за информацию, которую выдала её же система, а не третья сторона.

Mata v. Avianca. В США в 2023 году юрист, готовя иск против авиакомпании Avianca, использовал ChatGPT для поиска судебной практики и подал в суд документ со ссылками на несколько прецедентов. Прецеденты оказались полностью вымышленными — таких судебных решений с указанными номерами не существовало. Дело стало одним из первых широко освещённых случаев, где галлюцинация модели напрямую привела к профессиональным санкциям для человека, который на неё положился без проверки.

оценка оба кейса — общедоступные, широко освещённые случаи; при использовании точных цитат стоит сверяться с первичным судебным решением или крупным СМИ, а не только с пересказом на странице OWASP

Почему это риск ИБ, а не только репутации

Юридический и репутационный ущерб от галлюцинаций очевиден и без ИБ-контекста. Но есть отдельный сценарий, который относится именно к информационной безопасности: package hallucination, «отравление» через несуществующую зависимость. Модель, генерируя код, придумывает правдоподобное, но не существующее имя библиотеки. Атакующий заранее регистрирует пакет с таким именем в публичном реестре — npm, PyPI — и закладывает в него вредоносную нагрузку.

Разработчик, который доверяет сгенерированному коду и устанавливает пакет без проверки, вносит вредоносный компонент в свой проект сам, своими руками.

Формально это стык двух категорий OWASP: LLM09 (Misinformation) порождает недостоверный вывод, а эксплуатируется он уже по логике LLM03 Supply Chain — атаки на цепочку поставок компонентов. Полную систематику атак на ИИ, включая supply chain и другие классы, разбирает статья «Виды атак на ИИ и LLM»; таблицу всех десяти категорий с кодами LLM01–LLM10 — «OWASP Top 10 for LLM Applications».

Стоит явно развести галлюцинацию с соседним по разделу термином. Галлюцинация — непреднамеренная ошибка модели: никто специально не заставлял её соврать. Промпт-инъекция — обратная ситуация: атакующий намеренно составляет ввод так, чтобы модель выполнила не заложенную разработчиком инструкцию. Оба явления искажают ответ модели, но источник искажения и, соответственно, зона ответственности за исправление — разные.

оценка связка LLM09 ↔ LLM03 через package hallucination — логический вывод на основе описания «Unsafe Code Generation» в LLM09:2025, отдельно дословно на странице OWASP не процитирована

★ Что реально снижает галлюцинации — и что не сработает

Честный ответ здесь важнее удобного. Полностью устранить галлюцинации на нынешнем уровне архитектур LLM нельзя — это прямое следствие вероятностной генерации, а не баг, который можно точечно пропатчить в одной конкретной модели. OWASP формулирует рекомендации не как «лечение», а как снижение риска и его последствий.

01 · Grounding

RAG и цитирование источников

Подключение модели к верифицированным внешним источникам вместо опоры только на «память» весов, с обязательным указанием источника в ответе.

02 · Fine-tuning

Дообучение на профильных данных

Повышает точность модели в узкой предметной области за счёт более качественного и специфичного набора данных, чем общий претрейн.

03 · Human-in-the-loop

Проверка человеком

Обязательна для высокорисковых доменов — медицина, право, финансы, — где цена ошибки высока, а галлюцинация неотличима от факта на глаз.

04 · Валидация

Автоматическая проверка перед действием

Отдельный механизм сверки критичных выводов до того, как ответ модели используется в реальном действии — например, в агентном сценарии.

05 · Интерфейс

Честная коммуникация ограничений

Интерфейс должен явно сообщать о вероятности ошибок, а не создавать у пользователя ложное ощущение полной надёжности ответа.

06 · Код

Secure coding practices

Для кода, сгенерированного ИИ, — обязательная проверка существования и репутации предложенных зависимостей до установки, а не после инцидента.

Отдельная мера, которую OWASP тоже относит к митигациям, — обучение самих пользователей ограничениям LLM: человек, который знает, что модель может уверенно ошибаться, реже принимает её ответ за окончательный факт без проверки. Это не техническая мера, но она напрямую снижает эффект overreliance, описанный выше.

факт 7 мер митигации — дословный список genai.owasp.org/llmrisk/llm092025-misinformation

Частые вопросы

Что такое галлюцинация в работе нейросети?
Это ответ языковой модели, который звучит уверенно и правдоподобно, но фактически неверен или полностью вымышлен. Модель не «знает», что ошиблась, и не помечает такой ответ как менее надёжный — он выглядит точно так же, как достоверный факт. В OWASP Top 10 for LLM Applications 2025 это часть категории LLM09:2025 Misinformation. Метка: факт — genai.owasp.org/llmrisk/llm092025-misinformation.
Почему нейросеть вообще выдаёт неверную информацию?
Языковая модель — вероятностный генератор следующего токена, обученный продолжать текст статистически правдоподобным образом, а не система с внутренней проверкой фактов. При пробелах в обучающих данных модель заполняет их правдоподобным, но не обязательно верным содержанием. Усугубляет это overreliance — чрезмерное доверие пользователя к ответу без проверки. Метка: факт — механизм по OWASP LLM09:2025.
Есть ли реальные примеры галлюцинаций нейросети?
Да. Чат-бот Air Canada сообщил пассажиру о скидке на билет, которой на самом деле не было в правилах компании, — трибунал обязал перевозчика выполнить обещание бота. В деле Mata v. Avianca (США, 2023) юрист сослался в суде на судебные прецеденты, которые ChatGPT выдумал полностью, — реальных решений с такими номерами не существовало. Метка: оценка — широко задокументированные общедоступные кейсы, сверять дословные цитаты по первоисточнику.
Что рекомендуется делать для снижения галлюцинаций нейросети?
Полностью убрать галлюцинации нельзя, но риск снижают: RAG — подключение модели к проверенным внешним источникам с обязательным цитированием; дообучение на качественных данных узкой предметной области; обязательная проверка человеком в критичных сценариях (медицина, право, финансы); автоматическая валидация ответа перед тем, как он используется в действии; честное информирование пользователя об ограничениях модели. Метка: факт — дословный список митигаций genai.owasp.org/llmrisk/llm092025-misinformation.
К какому пункту OWASP LLM Top 10 относятся галлюцинации?
К LLM09:2025 Misinformation (дезинформация). В редакции 2025 года эта категория объединила прежнюю галлюцинацию и категорию 2023 года Overreliance — чрезмерное доверие пользователей к выводам модели без проверки. Полную таблицу всех десяти категорий OWASP LLM Top 10 2025 — в отдельном разборе. Метка: факт — код и переименование категории по genai.owasp.org.

Хаб «Безопасность ИИ» на SecRadar

Промпт-инъекция, джейлбрейк, полная систематика атак на ИИ и российские решения класса AI Security — независимый разбор без привязки к вендору.

Открыть хаб «Безопасность ИИ»
Telegram-канал SecRadar
Сводка рынка ИБ России — каждую неделю

Новые продукты и сертификаты ФСТЭК, ходы вендоров, дедлайны регуляторов — коротко и со ссылками на первоисточники.

Подписаться →