Контекстное окно — предел объёма текста, который модель обрабатывает за один раз. В него входит всё сразу: скрытая инструкция сервиса, вся история переписки, содержимое прикреплённых файлов и сам ответ. Постоянной памяти у модели нет — каждый ответ она собирает заново, перечитывая то, что поместилось в окно.
Отсюда эффект, который выглядит как поломка: на 20-м сообщении модель перестаёт выполнять требование, заданное в 1-м. Ничего не сломалось — начало диалога просто вытеснено более свежими репликами. Понимание этой границы превращает нейросеть из капризного собеседника в предсказуемый инструмент с понятным и управляемым ресурсом.
Что такое контекстное окно на практике#
Модель не помнит вас между запросами. При каждом обращении ей заново подают весь текст: инструкцию, историю переписки, содержимое вложений. Контекстное окно — предел этой порции. Всё, что в неё не поместилось, для модели просто не существует, и она не может об этом сообщить.
Считается окно не в словах и не в страницах, а в токенах — кусках текста длиной от одного символа до целого слова. Точный расход заранее не посчитать, но пропорция сохраняется: чем длиннее текст, тем больше места он занимает. Русский расходует окно быстрее английского той же длины, потому что дробится на более мелкие куски.
Полезнее думать об окне не как о памяти, а как о рабочем столе. На стол помещается ограниченное число бумаг. Кладёте новую, когда место кончилось, — старая уходит со стола, причём не в архив, а насовсем. Модель при этом не предупреждает о пропаже: она уверенно отвечает по тому, что видит сейчас.
Что расходует окно, кроме вашего вопроса#
Сам вопрос занимает малую долю окна. Основной расход дают 3 вещи: системная инструкция сервиса, которую вы не видите, вся история диалога вместе с ответами модели и прикреплённые файлы целиком — а не только те фрагменты, что относятся к делу. Первую вы не контролируете, две остальные — полностью.
Ответы съедают окно быстрее вопросов. Развёрнутый ответ на пару абзацев вопроса легко выходит на страницу, и она остаётся в переписке навсегда. Диалог из 30 реплик — это не 30 ваших вопросов, а 30 вопросов и 30 ответов, каждый из которых входит в контекст следующего запроса.
Файлы — самая недооценённая статья расхода. Крупная таблица занимает несоразмерно много места, даже если вопрос касается пары строк: в окно уходит весь файл целиком — служебные колонки, повторяющиеся заголовки, пустые ячейки и строки за другие периоды. Отфильтровать вложение на входе нельзя, отбор делаете вы до загрузки. Правило простое: прикладывать не весь архив «на всякий случай», а тот минимум, без которого ответ невозможен. Отобрать нужные строки руками почти всегда быстрее, чем разбирать размытый ответ.
Отдельная ловушка в том, что о вытеснении никто не предупреждает. Модель не пишет «начало диалога потеряно» — она достраивает недостающее правдоподобным продолжением. Так теряются условия, заданные в начале, и появляются выдуманные детали в уверенной формулировке.
4 признака того, что окно кончилось#
Первый: модель переспрашивает то, что вы уже сообщили. Название компании, цифру, ограничение по бюджету — всё это было в третьем сообщении, а к пятнадцатому исчезло. Обычно на это реагируют раздражением и повтором, хотя повтор лишь ускоряет вытеснение остального.
Второй: перестаёт держать формат. Договорились об ответах таблицей из 3 колонок — получаете сплошной текст. Требование к формату стояло в начале диалога и ушло из окна первым, потому что вытесняется всегда самое раннее, а не самое неважное. Порядок вытеснения не зависит от того, насколько условие для вас критично.
Третий: противоречит сам себе. Ранняя реплика утверждала одно, поздняя — обратное, и расхождения модель не замечает: раннего ответа она больше не видит. Особенно опасно в расчётах, где по ходу диалога поменялось одно исходное число, а вы сверяете только итоговую цифру.
Четвёртый: при работе с длинным файлом ответы становятся общими и опираются на начало или конец документа, а середину как будто пропускают. Считать это законом не нужно, но проверять стоит: задайте вопрос по фрагменту, который заведомо лежит в середине, и сверьте ответ с оригиналом. Общий ответ или ответ мимо означает, что документ пора разбирать частями, а не надеяться, что модель прочла его ровно от первой строки до последней.
Как работать с длинными документами#
Порядок работы с большим документом состоит из 3 шагов. Первый — разрезать текст по смысловым блокам: главы, разделы, периоды. Резать нужно по смыслу, а не по объёму, иначе половина мысли останется в одном куске, половина в другом, и обе будут разобраны неверно.
Второй шаг — после каждого блока просить короткий конспект: что важно, какие цифры, какие условия. Конспект вы сохраняете у себя. Третий — итоговый вопрос задавать по собранным конспектам, а не по исходнику: толстый документ ужимается до пары страниц и помещается в окно с запасом.
Критерий выбора инструмента такой. Если ответ должен опираться на 2 абзаца из большого документа, загружать документ целиком бессмысленно — нужен сервис, который сам находит нужные фрагменты и подаёт модели только их. Так устроена работа с базой знаний компании; подробнее о том, как готовить свои данные для нейросети.
Ещё одна привычка, экономящая время: заводить отдельный диалог под каждую задачу. Длинная переписка обо всём подряд тратит окно на посторонние ветки и к концу дня отвечает хуже, чем свежий диалог с точной постановкой вопроса. Закрывать старый диалог не жалко: ценное из него вы уже перенесли в конспект.
Вывод: окно как ресурс, который тратится#
Контекстное окно — не характеристика памяти, а бюджет на один запрос. В бюджет входит всё: скрытая инструкция сервиса, история переписки, вложенные файлы и сам ответ модели. Тратится он с каждой репликой и сам собой не пополняется, а по достижении предела старое просто исчезает без предупреждения.
Практических следствий 3. Прикладывать только то, что нужно для конкретного ответа. Держать диалоги короткими и тематическими. Длинные материалы разбирать частями, сохраняя конспекты вне переписки, чтобы к финальному вопросу подойти с выжимкой, а не с исходником.
Признак исчерпания окна — не сообщение об ошибке, а тихая деградация: модель забывает условия, теряет формат, противоречит себе. Заметили такое — не спорьте с ней и не повторяйте требование в третий раз, а перезапустите диалог, начав его с конспекта уже принятых решений.
И главное: рост окна у новых моделей не отменяет дисциплины. Чем больше текста подано, тем труднее удержать в нём приоритеты, и качество ответа падает раньше, чем упирается в формальный лимит. Короткий точный контекст стабильно выигрывает у длинного и полного.