OpenAI поставила под сомнение ценность SWE-Bench Pro — главного бенчмарка для оценки ИИ в программировании. Выяснилось, что модели, которые легко решают тестовые задачи, на реальных проектах часто дают сбой. Проблема в том, что сами тесты давно устарели и плохо составлены. Теперь сотни исследований, опирающихся на эти данные, выглядят сомнительно.
Индустрия столкнулась с фундаментальной проблемой. Большинство бенчмарков создавались наспех — без чёткого понимания, какие именно навыки они должны проверять. Они заточены под синтаксически правильный код, но игнорируют читаемость, масштабируемость и соответствие стилю проекта.
В реальности ИИ-ассистент ценят не только за готовый код, но и за процесс его генерации. Важно, сколько итераций он делает, насколько полезны его подсказки для разработчика. Лабораторные цифры и практика разошлись кардинально.
Тесты против реальности
Ситуация напоминает 1980-е, когда экспертные системы блестяще проходили тесты, но проваливались в реальных условиях. Сейчас всё серьёзнее — венчурные фонды вкладывают миллиарды в ИИ-стартапы, ориентируясь именно на эти кривые метрики. Уже есть случаи, когда компании отказывались от моделей с «рекордными» баллами в пользу менее раскрученных, но предсказуемых решений.
Главная проблема современных бенчмарков — их статичность. В реальном мире требования меняются ежедневно: появляются новые библиотеки, обновляются API, меняются стандарты. Тестовые задания застыли во времени, как мухи в янтаре.
С legacy-кодом вообще катастрофа. Чтобы с ним работать, нужно понимать исторический контекст, но тесты этот нюанс упорно игнорируют. При этом legacy составляет 80% рабочего времени разработчиков в крупных проектах.
Некоторые компании уже ищут выход. Google тестирует бенчмарк, где ИИ должен не только написать код, но и объяснить своё решение. Другие экспериментируют с оценкой моделей в реальных open-source проектах, где код проверяет живое сообщество.
Пока это капля в море. Хорошие тесты требуют миллионов долларов и участия сотен программистов. У академиков и корпораций нет мотивации вкладываться по-настоящему.
Что дальше
Будущее, скорее всего, за адаптивными бенчмарками, которые эволюционируют вместе с ИИ. Уже появляются экспериментальные системы, встроенные в CI/CD, где модель должна не просто написать код, но и пройти код-ревью, исправить замечания — полный цикл, как в реальной работе. Платформы вроде BabelCode или CodeContests пытаются учесть прошлые ошибки, предлагая мультиязычные задачи с динамической проверкой.
Но может, стоит вообще отказаться от универсальных бенчмарков? Отдельные тесты для веба, embedded-систем или data science повысили бы точность оценок, хотя и сделали невозможным прямое сравнение моделей.
Нынешний кризис — шанс пересмотреть саму философию тестирования. Вместо поиска «идеального» бенчмарка нужна гибкая система валидации, которая учитывает и технические нюансы, и человеческий фактор. Пока же к результатам даже топовых моделей стоит относиться скептически — высокий балл в тесте не гарантирует, что ИИ не наломает дров в реальном проекте.
