Южнокорейские исследователи из Университета Йонсей сделали то, что годами не удавалось в Machine Learning. Их метод OptiFlow не просто даёт прирост эффективности на 15-20% — он ломает фундаментальный барьер в обучении ИИ. Как принимать разумные решения, когда данных мало, а вариантов действий — сотни?

Проблема оффлайн-обучения напоминает попытку научиться водить, изучая только записи аварий и идеальных поездок. До сих пор алгоритмы либо слепо копировали “успешные” стратегии, либо тонули в море альтернатив. Flow-политики теоретически могли улавливать многовариантность, но на практике ценностные функции вырезали “лишние” данные — с катастрофическими последствиями в реальных условиях.

Прорыв OptiFlow — в математике оптимального транспорта. Вместо тупой максимизации “полезности” алгоритм аккуратно взвешивает варианты, как опытный шахматист, который держит в уме сразу несколько стратегий. Он учитывает и геометрическую близость действий, и их потенциальную выгоду — без фатальной привязки к “очевидным” решениям.

На стандартных тестах D4RL и RL Unplugged метод не просто избежал переоценки ценностей — главной беды предыдущих подходов. Он сохранил способность выбирать из десятков вариантов, когда это необходимо. Код на Python с использованием JAX сделал систему практичной: разработчики специально сократили количество подбираемых параметров до минимума.

Сферы применения — от медицины, где цена ошибки измеряется жизнями, до финансов с их вечным балансом риска и доходности. Пока OptiFlow не проверяли на гигантских моделях, но архитектура позволяет масштабироваться. Главный вопрос теперь — как быстро индустрия перестроится с привычных, но ограниченных методов на этот гибкий подход.