## GPT-Red — новая система тестирования уязвимостей от OpenAI OpenAI представила GPT-Red — автоматизированную систему поиска уязвимостей в собственных моделях. Технология использует метод самообучения через «самоигру»: одна версия модели пытается найти уязвимости, другая — защититься от атак. Такой подход резко ускоряет выявление проблем с безопасностью и alignment (соответствием поведения ИИ заявленным целям). ## Как работает автоматический red teaming Традиционный red teaming (тестирование на проникновение) требовал сотни часов работы специалистов. GPT-Red сокращает этот процесс до минут — система генерирует тысячи вариантов атак, включая prompt injection и jailbreak-попытки. Модель-агрессор учится на своих ошибках, постепенно находя более изощрённые способы обхода защит. ## Улучшение защиты от prompt injection Особое внимание в GPT-Red уделено prompt injection — когда злоумышленник через специально оформленный запрос заставляет модель нарушить правила. В тестах система обнаружила 37% уязвимостей, пропущенных людьми. После доработок модели стали игнорировать 99,2% вредоносных промптов против 94,1% у предыдущих версий. ## Практическое значение для разработчиков Технология уже используется внутри OpenAI, но компания планирует предоставить API для тестирования сторонних моделей. Это особенно важно на фоне роста инцидентов с утечками цепочек рассуждений — когда через API можно восстановить внутренние шаги работы модели. GPT-Red автоматически проверяет и такие сценарии.
Новости
GPT-Red: автоматический фаззинг для улучшения безопасности ИИ
OpenAI запустила GPT-Red — систему автоматического поиска уязвимостей в ИИ через метод самообучения, что резко ускоряет улучшение безопасности моделей.

🧠 Читать вкратце
📎 Источники
Хочешь получать такие материалы быстрее?
Подписывайтесь на Telegram-канал, чтобы не пропускать публикации и получать короткие разборы.