Как ResiSpec решает проблему медленного авторегрессивного декодирования

Скорость генерации текста большими языковыми моделями (LLM) упирается в их пошаговую природу: каждый новый токен требует полного прохода через модель. Техника спекулятивного декодирования (Speculative Decoding) пытается обойти это ограничение, используя «черновик» от более лёгкой модели — но до сих пор её эффективность упиралась в проблему Residual Drift («дрейфа остатков»). Новый метод ResiSpec, представленный 26 августа 2026 года на arXiv, предлагает элегантное математическое решение, дающее почти двукратный прирост скорости.

Почему много кандидатов — не всегда хорошо

Традиционные методы спекулятивного декодирования генерируют несколько вариантов продолжения текста через упрощённую модель, а затем проверяют их основным LLM за один параллельный проход. Казалось бы, чем больше кандидатов — тем выше шанс, что один «пройдёт». Но на практике после отклонения первых вариантов распределение вероятностей для следующих токенов сильно смещается относительно исходных предсказаний черновой модели. Этот Residual Drift делает последующие кандидаты бесполезными и вынуждает систему пересчитывать их с нуля.

Формула, которая перераспределяет вероятности

ResiSpec перестраивает процесс верификации, математически корректируя предложенное распределение так, чтобы «остаточная» вероятность после отклонения кандидатов оставалась в зоне высокой достоверности черновой модели. Ключевая хитрость — пересчёт весов без нарушения точности итогового вывода. В результате каждый новый кандидат остаётся релевантным, а система реже уходит в дорогостоящий пересчёт.

Практическая выгода: от 1.45× до 1.92× прироста

Тесты против state-of-the-art методов (особенно на длинных последовательностях) показывают устойчивый прирост скорости в 1.5–1.9 раза.

Код уже доступен на GitHub под открытой лицензией, что упрощает внедрение в существующие пайплайны генерации текста. Для сервисов, где важна скорость ответа LLM (чат-боты, автоматическое кодирование, мгновенный перевод), это значит реальное снижение затрат на инфраструктуру.

Что дальше.

Метод особенно перспективен для сценариев с высокой вариативностью продолжений — там, где традиционные подходы к спекулятивному декодированию работали хуже всего. Следующий логичный шаг — интеграция с аппаратными ускорителями (например, оптимизация под TPU v5), где можно выжать ещё больше от этого подхода за счёт параллелизма.