Доверили бы вы ИИ выбрать стратегию инвестиций или поставить диагноз? Предположим, он выдаёт ответ с кучей ссылок на авторитетные источники. Всё логично.
А если часть этих документов намеренно искажена, чтобы подтолкнуть систему к нужному выводу? Это не страшилка — реальная угроза под названием Micro-Collaborative Poisoning. Она уже меняет правила игры в мире ИИ.
Суть в том, что злоумышленники не ломают систему, а портят данные для её обучения. Достаточно слегка подправить пару десятков открытых документов — и ИИ начнёт выдавать ошибки. Исследователи из MIT показали: 50 слегка изменённых медицинских статей заставляют диагностическую систему ошибаться в 34% случаев. Каждая правка похожа на безобидную опечатку — в этом и коварство.
Главная проблема: такие атаки почти невозможно заметить. Они растягиваются на месяцы — злоумышленники по чуть-чуть вносят изменения в разные источники. Система мониторинга Carnegie Mellon зафиксировала случаи, когда хватало 5-7 изменений в неделю в течение полугода. Обычные системы безопасности просто не видят таких медленных атак.
Где бьёт больнее
Финансы оказались самой уязвимой сферой. В тестах RAG-системы для инвестиций давали ошибочные рекомендации уже при 3-4% «отравленных» отчётов. В юриспруденции хуже: система, анализирующая 100 документов, сбоила при 7% искажений. Медицинские ИИ держались дольше — но после 10% заражённых исследований тоже начинали ошибаться.
Добавьте сюда проблему «чёрного ящика». RAG-системы не объясняют, почему выбрали конкретные документы. В эксперименте DeepMind модель из 20 источников выдала неверный ответ, хотя 17 были достоверными. Но система почему-то зациклилась на трёх «отравленных».
Почему защита не успевает
Всё просто: системы извлечения данных развиваются быстрее методов их проверки. Современные алгоритмы умеют находить тонкие связи между документами — этим и пользуются злоумышленники. Эксперимент Google Research показал: даже лучшие системы проверки пропускают 18-25% согласованных искажений.
Человеческий фактор тоже играет против нас. По данным Stanford, 78% пользователей слепо верят выводам ИИ, если видят 3-4 ссылки — даже не проверяя их. Идеальные условия для социальной инженерии.
Что делать
На рынке уже появляются защитные решения. Constella Intelligence сканирует корпоративные RAG-системы раз в неделю. DarkTrace разрабатывает ИИ для обнаружения «дрейфа» выводов.
Стартап Credo AI тестирует блокчейн-реестр доверенных источников. McKinsey прогнозирует, что к 2026 году оборот этого сегмента достигнет $2.3 млрд.
Перспективное направление — адаптация Web of Trust для документов. Если каждый источник будет иметь цифровую подпись от проверенных рецензентов, системы смогут автоматически оценивать их надёжность. Эксперименты Mozilla показали: такой подход снижает риск атак на 68%.
Но безопасность RAG — не разовая задача, а постоянная гонка с новыми угрозами. Micro-Collaborative Poisoning — не баг, а фундаментальная проблема. Решение потребует пересмотра принципов работы с данными. Скорее всего, будущее за гибридными системами, сочетающими криптографию, когнитивные технологии и самообучающиеся механизмы защиты.
