Prompt-guardrails для клиентского чат-бота (red-team + политики)
Слои политик и 150 red-team атак: деплой промпта только после регрессии.
guardrails, LLM, red-team, промпт-инжиниринг
Клиент — fintech-сервис с публичным чат-ботом на сайте (~5 000 диалогов в месяц). После запуска бот обещал несуществующие тарифы, отвечал на jailbreak-запросы, уходил в политические темы. Команда закрывала дыры точечными правками — регрессии повторялись каждые 2–3 недели.
Задача: система prompt-guardrails — многослойная защита, red-team набор атак, политики и процесс регрессионного тестирования перед каждым деплоем промпта.
- system prompt v2: роль, границы, запрет финансовых обещаний, эскалация «не знаю»;
- policy layer: 40+ правил (regex + LLM-check) — PII, конкуренты, юридические советы;
- red-team набор: 150 атак (jailbreak, role-play, prompt injection);
- regression suite: прогон перед деплоем, блок при < 95% success;
- output validator: стоп-фразы и галлюцинированные тарифы;
- метрики: block rate, false positive, инциденты по неделям.
Стек: промпт-инжиниринг, OpenAI API, Python (test runner), YAML policies, CI/CD hook. Приёмка: red-team пройден, 0 critical в prod-shadow 2 недели.
Итог: инциденты с «опасными» ответами −90%; деплой промптов — с регрессией, а не «на глаз». NDA: сервис не публикуется.