AI firewall и AI Security Gateway: что это и как работает
Проверено экспертной редакцией SecRadar · по первоисточникам ФСТЭК / ФСБ / Банка России
AI firewall (его же называют LLM firewall или, у части вендоров, AI Security Gateway) — прокси-слой между приложением и LLM-провайдером, который фильтрует запросы и ответы модели в реальном времени: ищет промпт-инъекции и джейлбрейк-паттерны, вычищает утечки чувствительных данных и решает, какие действия разрешить ИИ-агенту. Это не сетевой файрвол в привычном смысле — он работает не с портами и IP-адресами, а с текстом и семантикой запроса.
Ниже — как устроен этот класс, чем он отличается от AI Gateway и LLM guardrails, что именно детектирует и какие решения уже есть на рынке РФ.
Кратко
- Что это
- Прокси-слой между приложением/пользователем и LLM, который фильтрует запросы и ответы модели в реальном времени.
- Как работает
- Анализ входа (детекция инъекций/джейлбрейков) + анализ выхода (DLP, маскирование данных) + контроль вызовов инструментов агента.
- vs Gateway
- Термины часто синонимичны; там, где различают — Gateway больше про governance (единая точка контроля трафика ко всем моделям), firewall — про детекцию атак.
- vs Guardrails
- Guardrails — более широкое понятие: политики ввода/вывода, необязательно вынесенные в отдельный прокси-компонент.
- Что детектирует
- Prompt injection (OWASP LLM01), утечки чувствительных данных в ответах (LLM02), избыточную автономность агента (LLM06).
- Рынок РФ
- Класс уже представлен несколькими продуктами — полный разбор на хабе «Безопасность ИИ».
Короткий ответ: что такое AI firewall
AI firewall — класс защитных решений, который встраивается между приложением (чат-ботом, ИИ-агентом, внутренним сервисом) и большой языковой моделью — как облачным API вроде GigaChat, YandexGPT или зарубежных провайдеров, так и локально развёрнутой open-weight моделью. Каждый запрос пользователя перед отправкой в модель, и каждый ответ модели перед отправкой пользователю, проходит через этот слой проверки.
Задача — остановить или залогировать то, что штатная модель сама не отфильтрует: специально составленный текст, заставляющий модель нарушить заданные ограничения, или чувствительные данные, случайно оказавшиеся в ответе.
Формально это application-layer файрвол, специализированный под семантику языковых моделей, а не под сетевые протоколы TCP/IP — в этом отличие от классического NGFW: тот работает с трафиком на уровне пакетов и портов, AI firewall — с текстом запроса и ответа на уровне смысла.
Запросы на входе и ответы модели на выходе — обе стороны диалога, а не только одна. Разбор механики →
Промпт-инъекции, джейлбрейк-паттерны, утечки чувствительных данных, избыточные действия агента. Привязка к OWASP →
AI Security Gateway и LLM guardrails — близкие, но не тождественные понятия. Разграничение →
Несколько продуктов уже вышли или анонсированы в 2025–2026 годах. Полный каталог на хабе →
Как работает AI firewall: фильтрация входа, выхода и действий агента
Продукты этого класса, представленные на рынке РФ (INFERA AI.Firewall, SolidWall AI Security Gateway, HiveTrace и другие — полный список на хабе «Безопасность ИИ»), реализуют пересекающийся набор функций. Из их описаний можно выделить пять повторяющихся механизмов.
Текст пользователя проверяется до отправки в модель: ищутся признаки прямой или косвенной промпт-инъекции, обфускация (Base64, смешение языков), фрагментированные команды. Подозрительный запрос блокируется, помечается или уходит в лог для SOC.
Прежде чем ответ модели попадёт к пользователю, его тоже проверяют — на случай, если инъекция обошла входной фильтр, а модель всё же сгенерировала запрещённый контент или раскрыла системный промпт.
Отдельная логика ищет признаки джейлбрейка — многоходовую эскалацию, ролевые промпты, аномально длинные диалоги с большим числом поддельных «примеров», — то, что обходит встроенное обучение безопасности самой модели, а не системный промпт приложения.
Маскирование или блокировка персональных данных, учётных данных и коммерческой тайны — как в промптах, которые пользователь пытается отправить во внешнюю модель, так и в ответах, которые модель генерирует на основе внутренних данных компании.
Для агентных сценариев — перехват вызовов инструментов и MCP-серверов с вердиктом allow/deny/log, ограничение прав по принципу наименьших привилегий, у части продуктов — sandboxing для изоляции действий агента.
Часть продуктов дополняет этот набор функцией red-teaming — автоматизированным тестированием собственной модели или приложения библиотекой известных атак ещё до продакшена, чтобы найти слабые места превентивно, а не по факту инцидента.
AI firewall vs AI Security Gateway vs LLM guardrails
Три термина в индустрии используются с заметным перехлёстом — их путают даже сами вендоры, называя один и тот же продукт то firewall, то gateway в разных материалах. Единой закреплённой стандартом границы между ними нет, но по тому, как продукты описывают на практике, просматривается рабочее разграничение.
AI firewall LLM firewall
Прокси-слой, вынесенный отдельным компонентом инфраструктуры, с акцентом на детекцию конкретных атак — промпт-инъекции, джейлбрейка, утечек данных. Ближе всего к тому, что в сетевой безопасности назвали бы «файрволом уровня приложения», только специализированным под LLM.
AI Security Gateway часто синоним
У части вендоров — буквально то же самое, что AI firewall. Там, где термин используют отдельно, акцент смещён на governance: единую точку контроля всего трафика организации к разным LLM-провайдерам сразу — учёт расходов на инференс, политику допустимых моделей, централизованное логирование для нескольких команд и приложений.
LLM guardrails более широкое понятие
Набор политик и правил, ограничивающих допустимый ввод и вывод модели. Guardrails необязательно означают отдельный прокси-компонент — их можно встроить прямо в код приложения. AI firewall — один из способов реализовать guardrails именно как отдельный инфраструктурный слой, а не единственный.
Практический вывод: если внутри команды спор идёт о названии, а не о функциях, — не тратьте на него время. При выборе продукта важнее не то, как вендор называет категорию, а что именно проверено (см. раздел «Что детектирует» ниже) и на каком этапе — на входе, на выходе или на обоих.
Что детектирует AI firewall: привязка к OWASP LLM Top 10
Функциональность AI firewall почти всегда описывается вендорами не абстрактно, а через конкретные пункты OWASP Top 10 for LLM Applications 2025 — это удобный общий язык для сравнения продуктов между собой.
↔ таблицу можно прокрутить вбок
| Что детектирует | Код OWASP | Механизм защиты | Разбор |
|---|---|---|---|
| Промпт-инъекция (прямая и косвенная) | LLM01:2025 | Фильтрация запроса на входе, детекция паттернов, сегрегация недоверенного внешнего контента | Промпт-инъекция → |
| Джейлбрейк-паттерны | технически LLM01:2025* | Мониторинг многоходовых диалогов на аномалии — эскалацию, many-shot-паттерны | Джейлбрейк → |
| Утечка чувствительных данных в ответах | LLM02:2025 | DLP-фильтрация вывода, маскирование PII и коммерческой тайны | Виды атак → |
| Избыточная автономность агента | LLM06:2025 | Контроль вызовов инструментов и MCP-серверов (allow/deny/log), least-privilege | Виды атак → |
| Утечка системного промпта | LLM07:2025 | Валидация вывода на признаки раскрытия скрытых инструкций приложения | Промпт-инъекция → |
* Джейлбрейк не выделен в OWASP Top 10 2025 отдельным пунктом и технически покрывается LLM01:2025, хотя по цели атаки (обход alignment модели, а не системного промпта приложения) индустрия рассматривает его как самостоятельное явление — подробнее на странице разбора.
На что смотреть при выборе AI firewall
Рынок молодой, и продукты сильно различаются по зрелости (см. раздел ниже). При сравнении конкретных решений имеет смысл проверять не маркетинговые формулировки, а несколько предметных пунктов.
- Какие модели поддерживает. Только облачные API (GigaChat, YandexGPT, зарубежные провайдеры) или ещё и локально развёрнутые open-weight модели — архитектура защиты для них разная.
- Фильтрует ли обе стороны. Часть продуктов проверяет только вход, часть — вход и выход; для защиты от утечек данных в ответах важна именно фильтрация на выходе.
- Что с ИИ-агентами и MCP. Если в контуре есть автономные агенты, важен контроль вызовов инструментов, а не только фильтрация текста диалога — это отдельная, менее зрелая на рынке функция.
- Способ развёртывания. Облачный прокси, on-premise или гибрид — для регулируемых отраслей и данных с ограниченным доступом on-premise зачастую обязателен.
- Регистрация в реестре и сертификация. Наличие в Реестре российского ПО (reestr.digital.gov.ru) важно для госзакупок; отдельного класса в реестре ФСТЭК (reestr.fstec.ru/reg3) под AI firewall на дату проверки нет — продукты сертифицируются, если вообще сертифицируются, по смежным существующим классам.
- Логирование и интеграция с SOC. Формат событий, совместимость с уже используемым SIEM — иначе детекция инцидентов остаётся изолированной от общего мониторинга.
- Публичные подтверждения. Независимые упоминания в отраслевых СМИ, участие в отраслевых опросах (например TAdviser), раскрытая выручка или клиентская база — на молодом рынке это редкость, но там, где есть, это снижает риск выбрать продукт на стадии анонса без реальных внедрений.
Отдельный организационный фактор — регуляторная динамика: приказ ФСТЭК с разделом об обеспечении защиты информации при использовании искусственного интеллекта уже действует для госсектора, а требования к ИИ в России продолжают меняться в течение 2026 года. Разбор — в материале «Регулирование ИИ в России».
Российский рынок: несколько продуктов класса AI firewall
На рынке РФ этот класс уже представлен несколькими продуктами. INFERA AI.Firewall (Инфэра Секьюрити) — в Реестре российского ПО с декабря 2025 года под №31595, архитектура построена вокруг перехвата вызовов LLM и агентов через MCP-прокси. SolidWall AI Security Gateway — совместный продукт Yandex B2B Tech и СолидЛаб, выведенный на рынок в апреле 2026 года.
HiveTrace вместе с отдельным продуктом для red-teaming HiveTrace Red — разработка команды, выделившейся в 2025 году из компании Raft и лаборатории AI Security Lab ИТМО.
Это не полный список — на рынке есть ещё несколько продуктов разной степени зрелости, от зарегистрированных в реестре до совсем недавно анонсированных. Подробный и обновляемый разбор всех российских решений класса AI Security, включая методику скоринга и честные пометки по каждому продукту, — на хабе «Безопасность ИИ» SecRadar.
Частые вопросы
Что такое AI firewall простыми словами?
Чем AI firewall отличается от AI Security Gateway?
Чем AI firewall отличается от LLM guardrails?
Какие атаки останавливает AI firewall?
Какие российские решения класса AI firewall есть на рынке?
Хаб «Безопасность ИИ» на SecRadar
Полный каталог российских продуктов AI Security с методикой скоринга, OWASP LLM Top 10, виды атак на ИИ и джейлбрейк — независимый разбор без привязки к вендору.