Окно контекста — это буфер, определяющий, сколько информации модель учитывает за один раз. В языковых моделях это может быть количество слов, токенов или символов. Чем больше окно, тем больше контекста доступно для анализа, но и выше вычислительные затраты.

Например, GPT-4 в 2024 году работала с окном в 32 тыс. токенов — примерно 50 страниц текста. Это позволяло ей поддерживать длинные диалоги, не теряя нить обсуждения. В компьютерном зрении окном контекста может быть фрагмент изображения, который нейросеть сканирует для распознавания объектов.

Размер окна критически важен для качества работы. Слишком маленькое — и модель «забывает» предыдущие данные. Слишком большое — требует непомерных ресурсов. Современные архитектуры, такие как Transformer, используют механизмы самовнимания, чтобы эффективно работать с большими контекстами, но даже они имеют пределы.