OpenAI поставила под сомнение ценность SWE-Bench Pro — главного бенчмарка для оценки ИИ в программировании. Выяснилось, что модели, которые легко решают тестовые задачи, на реальных проектах часто дают сбой. Проблема в том, что сами тесты давно устарели и плохо составлены. Теперь сотни исследований, опирающихся на эти данные, выглядят сомнительно.

Индустрия столкнулась с фундаментальной проблемой. Большинство бенчмарков создавались наспех — без чёткого понимания, какие именно навыки они должны проверять. Они заточены под синтаксически правильный код, но игнорируют читаемость, масштабируемость и соответствие стилю проекта.

В реальности ИИ-ассистент ценят не только за готовый код, но и за процесс его генерации. Важно, сколько итераций он делает, насколько полезны его подсказки для разработчика. Лабораторные цифры и практика разошлись кардинально.

Тесты против реальности

Ситуация напоминает 1980-е, когда экспертные системы блестяще проходили тесты, но проваливались в реальных условиях. Сейчас всё серьёзнее — венчурные фонды вкладывают миллиарды в ИИ-стартапы, ориентируясь именно на эти кривые метрики. Уже есть случаи, когда компании отказывались от моделей с «рекордными» баллами в пользу менее раскрученных, но предсказуемых решений.

Главная проблема современных бенчмарков — их статичность. В реальном мире требования меняются ежедневно: появляются новые библиотеки, обновляются API, меняются стандарты. Тестовые задания застыли во времени, как мухи в янтаре.

С legacy-кодом вообще катастрофа. Чтобы с ним работать, нужно понимать исторический контекст, но тесты этот нюанс упорно игнорируют. При этом legacy составляет 80% рабочего времени разработчиков в крупных проектах.

Некоторые компании уже ищут выход. Google тестирует бенчмарк, где ИИ должен не только написать код, но и объяснить своё решение. Другие экспериментируют с оценкой моделей в реальных open-source проектах, где код проверяет живое сообщество.

Пока это капля в море. Хорошие тесты требуют миллионов долларов и участия сотен программистов. У академиков и корпораций нет мотивации вкладываться по-настоящему.

Что дальше

Будущее, скорее всего, за адаптивными бенчмарками, которые эволюционируют вместе с ИИ. Уже появляются экспериментальные системы, встроенные в CI/CD, где модель должна не просто написать код, но и пройти код-ревью, исправить замечания — полный цикл, как в реальной работе. Платформы вроде BabelCode или CodeContests пытаются учесть прошлые ошибки, предлагая мультиязычные задачи с динамической проверкой.

Но может, стоит вообще отказаться от универсальных бенчмарков? Отдельные тесты для веба, embedded-систем или data science повысили бы точность оценок, хотя и сделали невозможным прямое сравнение моделей.

Нынешний кризис — шанс пересмотреть саму философию тестирования. Вместо поиска «идеального» бенчмарка нужна гибкая система валидации, которая учитывает и технические нюансы, и человеческий фактор. Пока же к результатам даже топовых моделей стоит относиться скептически — высокий балл в тесте не гарантирует, что ИИ не наломает дров в реальном проекте.