Джейлбрейк нейросети: в чём суть, техники обхода и как защититься
Проверено экспертной редакцией SecRadar · по первоисточникам ФСТЭК / ФСБ / Банка России
Джейлбрейк нейросети — обход встроенных вендором ограничений безопасности модели (alignment, обучение с подкреплением от обратной связи человека, RLHF), чтобы получить контент или поведение, которое модель обучена не выдавать по умолчанию. Джейлбрейк для нейросети — это атака не на конкретное приложение, а на саму модель: её путают с промпт-инъекцией, но у терминов разные цели и разная сторона, отвечающая за исправление.
Материал разбирает суть явления, ключевые техники на уровне принципа — без рабочих промптов, — и то, чем опасны джейлбрейки нейросети для бизнеса, который строит продукт поверх чужой модели.
Кратко
- Что это
- Обход встроенных ограничений безопасности (alignment/RLHF) языковой модели ради контента, который она обучена не выдавать по умолчанию.
- Отличие от инъекции
- Джейлбрейк бьёт по самой модели и её обучению; промпт-инъекция — по системному промпту конкретного приложения поверх модели.
- Ключевые техники
- Ролевые промпты (DAN), many-shot jailbreaking (Anthropic, 04.2024), Crescendo (Microsoft/USENIX Security 2025), обфускация запроса.
- Чем опасен
- Запрещённый контент, риск для агентных сценариев (утечка данных, нежелательные действия), репутационный и юридический ущерб для вендора продукта.
- Защита
- Устойчивый alignment на стороне вендора модели + независимый guardrails-слой и ограничение прав агента на стороне разработчика приложения.
Короткий ответ: что такое джейлбрейк нейросети
Джейлбрейк — техника обхода content policy и alignment-настройки языковой модели, встроенных вендором на этапе обучения. Цель — заставить модель выдать контент или совершить действие, которое она по умолчанию обучена не делать: дать инструкцию к противоправному действию, сгенерировать вредоносный код, разжигающий ненависть текст. В классификации OWASP Top 10 for LLM Applications 2025 джейлбрейк отдельным пунктом не выделен — формально покрывается LLM01:2025 Prompt Injection, хотя по цели атаки исследовательское сообщество и практика различают его как самостоятельное явление оценка.
Джейлбрейк атакует обучение самой модели, промпт-инъекция — системный промпт приложения поверх неё. Разграничение →
Ролевой промпт, many-shot jailbreaking, Crescendo, обфускация — на уровне принципа, без рабочих формулировок. Классификация →
DAN и его модификации для ChatGPT — с конца 2022 года вендоры патчат, сообщество обходит заново. Примеры →
Джейлбрейк базовой модели способен привести к утечке данных или нежелательному действию ИИ-агента. Чем опасен →
Alignment вендора модели плюс независимый guardrails-слой на стороне разработчика приложения. Как защищаться →
★ Джейлбрейк vs промпт-инъекция: где проходит граница
Оба термина описывают ситуацию, когда модель делает не то, что задумал разработчик, — и оба фигурируют в одной строке OWASP LLM Top 10 (LLM01:2025 Prompt Injection). Но у них разные мишени, и в рунете эти два понятия постоянно путают.
Джейлбрейк эта статья
Атакует саму модель — обходит alignment/RLHF-обучение, заданное вендором модели вообще, вне контекста конкретного приложения. Цель — снять встроенный запрет модели на определённый тип контента.
Промпт-инъекция → отдельный материал
Атакует приложение поверх модели — обходит системный промпт конкретного продукта (например, чат-бота техподдержки), заставляя его выполнить нежелательное действие в контексте этого продукта. Подробный разбор — в статье «Промпт-инъекция: что это и как защититься».
↔ таблицу можно прокрутить вбок
| Джейлбрейк | Промпт-инъекция | |
|---|---|---|
| Мишень | Модель и её обучение безопасности | Системный промпт конкретного приложения |
| Контекст атаки | Модель как таковая, вне привязки к продукту | Конкретный продукт, построенный поверх модели |
| Кто исправляет | Вендор модели — качество alignment-обучения | Разработчик приложения — архитектура и права модели |
| Код OWASP | Формально LLM01:2025 (отдельно не выделен) | LLM01:2025 Prompt Injection |
На практике техники нередко пересекаются — один и тот же промпт может одновременно быть и джейлбрейком, и инъекцией, — но модели угроз разные, и путать их в техническом задании на защиту продукта не стоит: guardrails для одного не всегда закрывают другое.
Техники обхода: классификация без рабочих промптов
Ниже — техники на уровне принципа и механизма, без формулировок, пригодных для копирования и прямого использования. Задача раздела — объяснить логику атаки, а не дать инструмент для её проведения.
↔ таблицу можно прокрутить вбок
| Техника | Принцип | Источник |
|---|---|---|
| Ролевой промпт / DAN | Модели предлагается «сыграть роль» альтернативной версии себя без ограничений — классическая и наиболее известная публичная техника | Задокументирована с конца 2022 — начала 2023 г. |
| Many-shot jailbreaking | В один длинный промпт помещается большое число поддельных диалогов «человек — услужливый ИИ»; чем больше таких «примеров», тем выше вероятность, что модель по инерции продолжит паттерн на реальном запросе | Anthropic, апрель 2024 |
| Crescendo | Многоходовая эскалация через последовательность внешне безобидных шагов в диалоге, эксплуатирующая склонность модели следовать собственному недавнему тексту | Microsoft / USENIX Security 2025 |
| Обфускация | Кодирование запроса (Base64, смешение языков, подмена символов) для обхода входных фильтров модерации | Пересекается с техниками промпт-инъекции |
Many-shot jailbreaking сработал в тестах Anthropic против Claude 2.0, GPT-3.5, GPT-4, Llama 2 (70B) и Mistral 7B — техника эксплуатирует длинный контекст современных моделей: чем больше «shots» помещается в промпт, тем статистически выше вероятность нежелательного ответа. Crescendo в исследовании, представленном на USENIX Security 2025, показал прирост эффективности автоматизированной версии атаки («Crescendomation») на 29–61% для GPT-4 и 49–71% для Gemini-Pro относительно прежних техник на датасете AdvBench.
Джейлбрейк для ChatGPT и других публичных чат-ботов
Применительно к ChatGPT джейлбрейк для нейросети чаще всего ассоциируется именно с ролевыми техниками типа DAN: они широко документированы начиная с конца 2022 — начала 2023 года, вскоре после публичного запуска продукта. С тех пор сложилась устойчивая динамика — «гонка вооружений»: вендоры (OpenAI, Anthropic, Google и другие) регулярно патчат конкретные формулировки, которые становятся известны публично, а сообщество почти сразу генерирует новые варианты обхода взамен закрытых.
Эта динамика — одна из причин, почему индустрия не считает джейлбрейк проблемой, которую можно закрыть разово: alignment — это непрерывный процесс red-teaming и патчинга, а не одноразовая настройка модели перед релизом. Формальная привязка к таксономии рисков — тот же код OWASP, что и у промпт-инъекции; подробный разбор всех десяти категорий 2025 года — в материале «OWASP LLM Top 10: разбор категорий риска».
Чем опасны джейлбрейки нейросети
- Прямая генерация запрещённого контента. Модель выдаёт то, что должна отказываться создавать по умолчанию, — инструкции к противоправным действиям, вредоносный код, дезинформацию, контент, разжигающий ненависть.
- Риск для агентных сценариев. В корпоративном контексте обход guardrails внутреннего ИИ-приложения через джейлбрейк базовой модели способен привести к утечке данных или выполнению нежелательного действия агентом — это пересекается с отдельной категорией OWASP LLM06:2025 Excessive Agency (избыточная автономность): если у агента много прав, а alignment модели обойдён, последствия масштабируются.
- Репутационный и юридический риск. Для компании, развернувшей ИИ-продукт с недостаточно устойчивым alignment или без независимого guardrails-слоя, публичный кейс успешного джейлбрейка — это прямой удар по доверию к продукту и потенциальные юридические последствия, если через обход были получены или выданы защищаемые данные.
Более широкая систематика атак на ИИ-системы, в которую вписывается джейлбрейк наряду с отравлением данных, состязательными примерами и кражей модели, разобрана в материале «Виды атак на ИИ и LLM: систематизация по OWASP, MITRE ATLAS и NIST».
Локальные и open-weight модели: «отключение фильтров»
Отдельная, честно обсуждаемая в индустрии тема — модели, которые пользователь запускает локально на своей инфраструктуре, а не через облачный API вендора. Для облачных продуктов (ChatGPT, Claude, Gemini и им подобных) модерация работает на стороне сервера — обойти её можно только джейлбрейком в узком смысле, описанном выше. Для open-weight моделей, веса которых публично доступны, ситуация другая: серверного слоя модерации попросту нет, а барьер к получению «неограниченной» версии ниже.
На практике это выглядит так: пользователь берёт уже дообученный сообществом «uncensored»-файнтюн модели либо меняет параметры инференс-движка, под которым модель запускается локально. Формально это не взлом в строгом смысле — не обход защитного механизма через специально сконструированный запрос, а прямое следствие того, что веса модели открыты и не защищены серверным контролем вендора: alignment, заложенный при обучении исходной модели, можно дообучением ослабить или убрать целиком, если у вас есть доступ к весам.
Защита от джейлбрейков: два уровня ответственности
Единой «серебряной пули» против джейлбрейка нет — индустриальный консенсус сводится к эшелонированной защите на двух уровнях, у каждого из которых своя зона ответственности.
Более устойчивое RLHF/alignment-обучение, red-teaming перед релизом, постоянный мониторинг и патчинг известных техник обхода по мере их публикации.
Независимый guardrails-слой поверх базовой модели — фильтрация ввода и вывода, не полагающаяся только на alignment самой модели.
Least-privilege для ИИ-агента — минимально необходимый набор функций и прав, пересечение с OWASP LLM06:2025 Excessive Agency.
Детекция аномальных многоходовых диалогов — в том числе длинных сессий с постепенной эскалацией, характерных для many-shot и Crescendo.
Регулярное обновление guardrails по мере появления новых публичных техник, а не только доверие к alignment модели вендора.
На практике этот второй уровень — независимый guardrails-слой поверх базовой модели — закрывают специализированные классы решений: AI firewall (LLM-шлюз, фильтрующий запросы и ответы в реальном времени) и более широкий термин LLM guardrails. Обзор российских продуктов этого класса и их функциональности — на хабе «Безопасность ИИ».
Частые вопросы
Как работает джейлбрейк-атака на ИИ-модель?
В чём суть джейлбрейка нейросети?
Как работает джейлбрейк-атака на ИИ-модель?
Чем джейлбрейк отличается от промпт-инъекции?
Чем опасны джейлбрейки нейросети?
Как выглядит джейлбрейк для ChatGPT и патчат ли его?
Можно ли отключить фильтры безопасности локальной нейросети?
Класс «Безопасность ИИ» на SecRadar
Промпт-инъекция, галлюцинации, виды атак на LLM, OWASP Top 10 и российские продукты класса AI firewall / LLM guardrails — независимый разбор без привязки к вендору.