В сентябре 2026 года OpenAI представила GPT-5.6, и это оказалось далеко не рядовым обновлением. Внутри API обнаружились два скрытых параметра — retain_chain_of_thought и enable_compaction. На первый взгляд, техническая мелочь, но их активация утроила баллы модели на тесте ARC-AGI-3, одном из самых сложных бенчмарков для оценки абстрактного мышления ИИ.
Раньше лучшие модели справлялись с 60-65% заданий, а GPT-5.6 показала результат в 185% от базового уровня. Это не просто улучшение — качественный скачок в решении задач, требующих многошагового логического вывода.
ARC-AGI-3 отличается от стандартных тестов: здесь модели должны выявлять закономерности в незнакомых данных, строить аналогии и делать выводы из ограниченной информации. Например, задание может включать набор абстрактных фигур с пропущенным элементом, который нужно восстановить. Раньше модели часто выбирали правдоподобный, но неверный вариант.
Теперь GPT-5.6 отслеживает каждое промежуточное предположение и корректирует ход мысли. В задачах на аналогии точность выросла на 40%, в логических головоломках — на 65%.
Что изменилось внутри модели
Первый параметр, retain_chain_of_thought, заставляет модель сохранять промежуточные рассуждения даже после формирования окончательного ответа. Раньше эти «черновики» удалялись для экономии ресурсов. Второй, enable_compaction, оптимизирует внутренние представления данных, уменьшая «шум» в процессе вывода. Вместе они создают эффект синергии: модель не теряет логические связи между шагами и при этом избегает избыточных вычислений.
Это особенно важно для задач, где критична последовательность мышления. Например, в медицинских кейсах GPT-5.6 правильно выстраивала цепочку «симптом → возможные причины → дифференциальная диагностика» в 83% случаев против 52% у стандартной версии. Однако есть и обратная сторона: включение параметров увеличивает время ответа на 15-20% и требует дополнительных 8% вычислительных ресурсов. Для массовых приложений это может быть избыточно, но в профессиональных инструментах — оправдано.
Почему это важно
Исторически языковые модели страдали от проблемы «забывания»: промежуточные шаги рассуждений терялись в процессе генерации ответа, что приводило к ошибкам в сложных задачах. Например, в задачах на планирование или многошаговое решение проблем модель могла «терять нить» уже на втором шаге. Новые параметры решают эту проблему, сохраняя логическую структуру рассуждений.
Для бизнеса это означает существенное повышение эффективности ИИ-решений. В финансовой аналитике модели смогут точнее прогнозировать рыночные тренды, учитывая множество взаимосвязанных факторов. В логистике это позволит оптимизировать маршруты и ресурсы, учитывая сложные зависимости.
Однако внедрение требует баланса между производительностью и точностью. Увеличение времени ответа может быть критичным для приложений, где важна скорость, таких как чат-боты или системы реального времени.
Будущее ИИ
Разработчики OpenAI уже начали тестировать аналогичные настройки в других моделях семейства, включая специализированные версии для программирования и научных задач. К октябрю 2026 года ожидается их интеграция в публичное API с возможностью ручного управления. Эта находка может стать поворотным моментом в разработке ИИ, особенно в контексте обучения с подкреплением и адаптации моделей к новым задачам.
Эффективное сохранение цепочки рассуждений может снизить количество данных, необходимых для обучения, так как модель будет лучше усваивать сложные зависимости. Это сократит время и стоимость разработки новых моделей, особенно в узкоспециализированных областях, где данных часто недостаточно.
В перспективе это открытие может привести к появлению новых стандартов проектирования языковых моделей. Например, разработчики могут начать активно использовать механизмы сохранения логической структуры в других типах ИИ, таких как трансформеры для анализа изображений или видео. Это может значительно повысить их способность к сложному анализу и прогнозированию.
Кроме того, эти параметры могут стать ключевыми для создания более «человекоподобного» ИИ, который не просто генерирует ответы, но и объясняет свои рассуждения. Это особенно важно для задач, где прозрачность и объяснимость критичны, таких как медицина или юриспруденция. Модели смогут не только предлагать решения, но и аргументировать их, что повысит доверие пользователей.
Новые вызовы
Но есть и фундаментальные вопросы. Как измерять качество сохраненных цепочек рассуждений? Традиционные метрики вроде BLEU или ROUGE здесь не работают — нужны новые способы оценки связности логических последовательностей. OpenAI уже анонсировала конкурс на разработку соответствующих метрик с призовым фондом $2 млн.
Экономический эффект может проявиться в неожиданных сферах. Например, в страховании точность оценки рисков напрямую зависит от учета сложных цепочек факторов. Предварительные расчеты показывают, что модели с новыми параметрами могут снизить ошибки андеррайтинга на $3-5 млрд ежегодно только в автокаско.
Эксперты прогнозируют волну стартапов, которые будут специализироваться именно на «логических надстройках» для существующих моделей. Аналогия — появление компаний, оптимизирующих SQL-запросы в 2000-х. Рынок таких решений может достичь $700 млн к 2028 году.
Что дальше
В конечном счете, главное значение этого открытия — в переходе от статистических языковых моделей к действительно рассуждающим системам. Это не просто улучшение точности, а качественный скачок в природе ИИ, приближающий его к человеческому мышлению с его способностью выстраивать сложные причинно-следственные связи. И те, кто научатся использовать этот потенциал первыми, получат серьёзное конкурентное преимущество.
