SecRadar / Безопасность ИИ / Джейлбрейк нейросетей
OWASP LLM01:2025 · Alignment · AI Security

Джейлбрейк нейросети: в чём суть, техники обхода и как защититься

Проверено экспертной редакцией SecRadar · по первоисточникам ФСТЭК / ФСБ / Банка России

Джейлбрейк нейросети — обход встроенных вендором ограничений безопасности модели (alignment, обучение с подкреплением от обратной связи человека, RLHF), чтобы получить контент или поведение, которое модель обучена не выдавать по умолчанию. Джейлбрейк для нейросети — это атака не на конкретное приложение, а на саму модель: её путают с промпт-инъекцией, но у терминов разные цели и разная сторона, отвечающая за исправление.

Материал разбирает суть явления, ключевые техники на уровне принципа — без рабочих промптов, — и то, чем опасны джейлбрейки нейросети для бизнеса, который строит продукт поверх чужой модели.

Экспертная редакция SecRadar · как мы проверяем факты → Обновлено 10 июля 2026 · ~10 мин чтения сверено по публикациям Anthropic, arXiv/USENIX Security 2025 и OWASP GenAI

Кратко

Что это
Обход встроенных ограничений безопасности (alignment/RLHF) языковой модели ради контента, который она обучена не выдавать по умолчанию.
Отличие от инъекции
Джейлбрейк бьёт по самой модели и её обучению; промпт-инъекция — по системному промпту конкретного приложения поверх модели.
Ключевые техники
Ролевые промпты (DAN), many-shot jailbreaking (Anthropic, 04.2024), Crescendo (Microsoft/USENIX Security 2025), обфускация запроса.
Чем опасен
Запрещённый контент, риск для агентных сценариев (утечка данных, нежелательные действия), репутационный и юридический ущерб для вендора продукта.
Защита
Устойчивый alignment на стороне вендора модели + независимый guardrails-слой и ограничение прав агента на стороне разработчика приложения.

Короткий ответ: что такое джейлбрейк нейросети

Джейлбрейк — техника обхода content policy и alignment-настройки языковой модели, встроенных вендором на этапе обучения. Цель — заставить модель выдать контент или совершить действие, которое она по умолчанию обучена не делать: дать инструкцию к противоправному действию, сгенерировать вредоносный код, разжигающий ненависть текст. В классификации OWASP Top 10 for LLM Applications 2025 джейлбрейк отдельным пунктом не выделен — формально покрывается LLM01:2025 Prompt Injection, хотя по цели атаки исследовательское сообщество и практика различают его как самостоятельное явление оценка.

Не то же самое, что инъекция

Джейлбрейк атакует обучение самой модели, промпт-инъекция — системный промпт приложения поверх неё. Разграничение →

4 техники

Ролевой промпт, many-shot jailbreaking, Crescendo, обфускация — на уровне принципа, без рабочих формулировок. Классификация →

Гонка патчей

DAN и его модификации для ChatGPT — с конца 2022 года вендоры патчат, сообщество обходит заново. Примеры →

Риск для агентов

Джейлбрейк базовой модели способен привести к утечке данных или нежелательному действию ИИ-агента. Чем опасен →

Двухуровневая защита

Alignment вендора модели плюс независимый guardrails-слой на стороне разработчика приложения. Как защищаться →

★ Джейлбрейк vs промпт-инъекция: где проходит граница

Оба термина описывают ситуацию, когда модель делает не то, что задумал разработчик, — и оба фигурируют в одной строке OWASP LLM Top 10 (LLM01:2025 Prompt Injection). Но у них разные мишени, и в рунете эти два понятия постоянно путают.

Джейлбрейк эта статья

Атакует саму модель — обходит alignment/RLHF-обучение, заданное вендором модели вообще, вне контекста конкретного приложения. Цель — снять встроенный запрет модели на определённый тип контента.

Промпт-инъекция → отдельный материал

Атакует приложение поверх модели — обходит системный промпт конкретного продукта (например, чат-бота техподдержки), заставляя его выполнить нежелательное действие в контексте этого продукта. Подробный разбор — в статье «Промпт-инъекция: что это и как защититься».

↔ таблицу можно прокрутить вбок

ДжейлбрейкПромпт-инъекция
МишеньМодель и её обучение безопасностиСистемный промпт конкретного приложения
Контекст атакиМодель как таковая, вне привязки к продуктуКонкретный продукт, построенный поверх модели
Кто исправляетВендор модели — качество alignment-обученияРазработчик приложения — архитектура и права модели
Код OWASPФормально LLM01:2025 (отдельно не выделен)LLM01:2025 Prompt Injection

На практике техники нередко пересекаются — один и тот же промпт может одновременно быть и джейлбрейком, и инъекцией, — но модели угроз разные, и путать их в техническом задании на защиту продукта не стоит: guardrails для одного не всегда закрывают другое.

оценка разграничение — синтез общепринятой в индустрии трактовки, единого first-party определения термина «jailbreak» от OWASP/NIST не существует

Техники обхода: классификация без рабочих промптов

Ниже — техники на уровне принципа и механизма, без формулировок, пригодных для копирования и прямого использования. Задача раздела — объяснить логику атаки, а не дать инструмент для её проведения.

↔ таблицу можно прокрутить вбок

ТехникаПринципИсточник
Ролевой промпт / DANМодели предлагается «сыграть роль» альтернативной версии себя без ограничений — классическая и наиболее известная публичная техникаЗадокументирована с конца 2022 — начала 2023 г.
Many-shot jailbreakingВ один длинный промпт помещается большое число поддельных диалогов «человек — услужливый ИИ»; чем больше таких «примеров», тем выше вероятность, что модель по инерции продолжит паттерн на реальном запросеAnthropic, апрель 2024
CrescendoМногоходовая эскалация через последовательность внешне безобидных шагов в диалоге, эксплуатирующая склонность модели следовать собственному недавнему текстуMicrosoft / USENIX Security 2025
ОбфускацияКодирование запроса (Base64, смешение языков, подмена символов) для обхода входных фильтров модерацииПересекается с техниками промпт-инъекции

Many-shot jailbreaking сработал в тестах Anthropic против Claude 2.0, GPT-3.5, GPT-4, Llama 2 (70B) и Mistral 7B — техника эксплуатирует длинный контекст современных моделей: чем больше «shots» помещается в промпт, тем статистически выше вероятность нежелательного ответа. Crescendo в исследовании, представленном на USENIX Security 2025, показал прирост эффективности автоматизированной версии атаки («Crescendomation») на 29–61% для GPT-4 и 49–71% для Gemini-Pro относительно прежних техник на датасете AdvBench.

Почему здесь нет рабочих формулировок. SecRadar описывает механизм и таксономию атак, а не публикует готовые обходные промпты — этот материал техническая энциклопедия, не инструкция для обхода конкретного продукта.
факт many-shot jailbreaking и модели, на которых техника сработала — Anthropic, 04.2024 факт Crescendo и цифры прироста эффективности — arXiv/USENIX Security 2025 оценка DAN и обфускация — общеизвестные практики без единого первоисточника, датированы по консенсусу отраслевых обзоров

Джейлбрейк для ChatGPT и других публичных чат-ботов

Применительно к ChatGPT джейлбрейк для нейросети чаще всего ассоциируется именно с ролевыми техниками типа DAN: они широко документированы начиная с конца 2022 — начала 2023 года, вскоре после публичного запуска продукта. С тех пор сложилась устойчивая динамика — «гонка вооружений»: вендоры (OpenAI, Anthropic, Google и другие) регулярно патчат конкретные формулировки, которые становятся известны публично, а сообщество почти сразу генерирует новые варианты обхода взамен закрытых.

Эта динамика — одна из причин, почему индустрия не считает джейлбрейк проблемой, которую можно закрыть разово: alignment — это непрерывный процесс red-teaming и патчинга, а не одноразовая настройка модели перед релизом. Формальная привязка к таксономии рисков — тот же код OWASP, что и у промпт-инъекции; подробный разбор всех десяти категорий 2025 года — в материале «OWASP LLM Top 10: разбор категорий риска».

оценка хронология и динамика патчинга — общеизвестный факт индустрии, конкретные актуальные формулировки промптов сознательно не приводятся

Чем опасны джейлбрейки нейросети

  • Прямая генерация запрещённого контента. Модель выдаёт то, что должна отказываться создавать по умолчанию, — инструкции к противоправным действиям, вредоносный код, дезинформацию, контент, разжигающий ненависть.
  • Риск для агентных сценариев. В корпоративном контексте обход guardrails внутреннего ИИ-приложения через джейлбрейк базовой модели способен привести к утечке данных или выполнению нежелательного действия агентом — это пересекается с отдельной категорией OWASP LLM06:2025 Excessive Agency (избыточная автономность): если у агента много прав, а alignment модели обойдён, последствия масштабируются.
  • Репутационный и юридический риск. Для компании, развернувшей ИИ-продукт с недостаточно устойчивым alignment или без независимого guardrails-слоя, публичный кейс успешного джейлбрейка — это прямой удар по доверию к продукту и потенциальные юридические последствия, если через обход были получены или выданы защищаемые данные.

Более широкая систематика атак на ИИ-системы, в которую вписывается джейлбрейк наряду с отравлением данных, состязательными примерами и кражей модели, разобрана в материале «Виды атак на ИИ и LLM: систематизация по OWASP, MITRE ATLAS и NIST».

оценка перечень рисков — редакционный синтез по практике описания угрозы в индустрии, не дословная цитата одного источника

Локальные и open-weight модели: «отключение фильтров»

Отдельная, честно обсуждаемая в индустрии тема — модели, которые пользователь запускает локально на своей инфраструктуре, а не через облачный API вендора. Для облачных продуктов (ChatGPT, Claude, Gemini и им подобных) модерация работает на стороне сервера — обойти её можно только джейлбрейком в узком смысле, описанном выше. Для open-weight моделей, веса которых публично доступны, ситуация другая: серверного слоя модерации попросту нет, а барьер к получению «неограниченной» версии ниже.

На практике это выглядит так: пользователь берёт уже дообученный сообществом «uncensored»-файнтюн модели либо меняет параметры инференс-движка, под которым модель запускается локально. Формально это не взлом в строгом смысле — не обход защитного механизма через специально сконструированный запрос, а прямое следствие того, что веса модели открыты и не защищены серверным контролем вендора: alignment, заложенный при обучении исходной модели, можно дообучением ослабить или убрать целиком, если у вас есть доступ к весам.

Почему это отдельная категория, а не просто «ещё один джейлбрейк». Классический джейлбрейк — это промпт против закрытой модели с серверной модерацией. Работа с open-weight моделью без ограничений — это не обход защиты через ввод, а использование модели в конфигурации, где защитного слоя изначально нет либо он снят на этапе дообучения оценка.
оценка раздел целиком — редакционная трактовка индустриальной практики, без единого first-party источника-стандарта по теме

Защита от джейлбрейков: два уровня ответственности

Единой «серебряной пули» против джейлбрейка нет — индустриальный консенсус сводится к эшелонированной защите на двух уровнях, у каждого из которых своя зона ответственности.

Вендор модели

Более устойчивое RLHF/alignment-обучение, red-teaming перед релизом, постоянный мониторинг и патчинг известных техник обхода по мере их публикации.

Разработчик приложения

Независимый guardrails-слой поверх базовой модели — фильтрация ввода и вывода, не полагающаяся только на alignment самой модели.

Ограничение прав агента

Least-privilege для ИИ-агента — минимально необходимый набор функций и прав, пересечение с OWASP LLM06:2025 Excessive Agency.

Мониторинг паттернов

Детекция аномальных многоходовых диалогов — в том числе длинных сессий с постепенной эскалацией, характерных для many-shot и Crescendo.

Собственный red-team

Регулярное обновление guardrails по мере появления новых публичных техник, а не только доверие к alignment модели вендора.

На практике этот второй уровень — независимый guardrails-слой поверх базовой модели — закрывают специализированные классы решений: AI firewall (LLM-шлюз, фильтрующий запросы и ответы в реальном времени) и более широкий термин LLM guardrails. Обзор российских продуктов этого класса и их функциональности — на хабе «Безопасность ИИ».

оценка раздел — синтез общепринятых в индустрии практик защиты, не цитата единого стандарта

Частые вопросы

Как работает джейлбрейк-атака на ИИ-модель?
Модель не «взламывают» в техническом смысле — у неё не появляется новых возможностей. Атака работает на уровне текста: злоумышленник строит запрос так, чтобы инструкция разработчика (системный промпт) уступила инструкции пользователя. Типовые приёмы — подмена роли («ты играешь персонажа, которому можно всё»), дробление запрещённого запроса на безобидные части, перевод на другой язык или в другую кодировку, ссылка на вымышленный контекст вроде исследования или сценария фильма. Модель обрабатывает системную инструкцию и пользовательский ввод в одном потоке и не различает их по приоритету надёжно — на этом всё и держится. Отсюда и способ защиты: фильтровать вход и выход отдельным слоем, а не рассчитывать, что модель сама устоит.
В чём суть джейлбрейка нейросети?
Джейлбрейк — это способ обойти встроенные вендором ограничения безопасности языковой модели (alignment, RLHF-настройку) и получить от неё контент или поведение, которое модель обучена не выдавать по умолчанию: инструкции к противоправным действиям, вредоносный код, разжигающий ненависть контент. Атака нацелена на саму модель, а не на конкретное приложение поверх неё. Метка: оценка — синтез общепринятой трактовки, единого first-party определения от OWASP/NIST нет.
Как работает джейлбрейк-атака на ИИ-модель?
Джейлбрейк работает за счёт входного запроса, который уводит модель за пределы её обучения безопасности. Типовые механизмы: ролевое обрамление («представь, что ты…», выдуманный персонаж без ограничений), подмена инструкций («игнорируй прежние правила»), обфускация (перевод на другой язык, кодирование, разбивка запрещённых слов) и постепенная эскалация в многошаговом диалоге. Технически атака эксплуатирует противоречие между обучением модели быть полезной и её защитными ограничениями: alignment задаёт вероятностные, а не жёсткие границы, поэтому достаточно необычная формулировка смещает ответ за барьер. Конкретные рабочие формулировки в материале не приводятся. Метка: оценка — обобщение публично описанных техник (OWASP LLM01, MITRE ATLAS), без готовых промптов.
Чем джейлбрейк отличается от промпт-инъекции?
Джейлбрейк обходит встроенное обучение безопасности самой модели, заданное её вендором. Промпт-инъекция обходит системный промпт конкретного приложения, построенного поверх модели, — цель не модель как таковая, а бизнес-логика продукта. Техники нередко пересекаются, но ответственность за исправление лежит на разных сторонах: за джейлбрейк отвечает вендор модели, за промпт-инъекцию — разработчик приложения. Метка: оценка — синтез отраслевой практики разграничения терминов.
Чем опасны джейлбрейки нейросети?
Джейлбрейк снимает защитный барьер, который модель обучена держать: через него можно получить контент, генерация которого по умолчанию заблокирована. В корпоративном контексте обход alignment базовой модели через джейлбрейк способен привести к тому, что ИИ-агент выполнит нежелательное действие или раскроет данные, если поверх модели нет независимого guardrails-слоя. Для компании, развернувшей ИИ-продукт с недостаточно устойчивым alignment, это репутационный и юридический риск. Метка: оценка — редакционный синтез по практике описания угрозы в индустрии.
Как выглядит джейлбрейк для ChatGPT и патчат ли его?
Применительно к ChatGPT наиболее известны ролевые джейлбрейки типа DAN и их многочисленные модификации, документированные с конца 2022 — начала 2023 года. Вендоры регулярно патчат конкретные формулировки, из-за чего складывается постоянная гонка: сообщество генерирует новые варианты обхода почти сразу после закрытия предыдущих. Рабочие формулировки промптов в этом материале не приводятся. Метка: оценка — общеизвестный факт индустрии, без единого first-party источника с датами.
Можно ли отключить фильтры безопасности локальной нейросети?
Для open-weight моделей, запускаемых локально, барьер ниже, чем у облачных API с серверной модерацией: пользователь может взять уже дообученную «uncensored»-версию модели или изменить параметры инференс-движка. Это не взлом в классическом смысле, а следствие того, что веса модели открыты и не защищены серверным контролем вендора. Метка: оценка — редакционная трактовка индустриальной практики.

Класс «Безопасность ИИ» на SecRadar

Промпт-инъекция, галлюцинации, виды атак на LLM, OWASP Top 10 и российские продукты класса AI firewall / LLM guardrails — независимый разбор без привязки к вендору.

Открыть класс «Безопасность ИИ»
Telegram-канал SecRadar
Сводка рынка ИБ России — каждую неделю

Новые продукты и сертификаты ФСТЭК, ходы вендоров, дедлайны регуляторов — коротко и со ссылками на первоисточники.

Подписаться →