Что такое токен в ChatGPT и зачем он нужен
Токен — это минимальная единица текста, которую обрабатывает языковая модель. В отличие от символов или слов, токены могут быть как целыми словами, так и их частями, знаками препинания, пробелами или фрагментами кода. Например, слово «ChatGPT» может быть одним токеном, а слово «токенизация» — двумя или тремя, в зависимости от модели.
OpenAI использует токены для измерения объёма входных данных (промпта) и сгенерированного ответа. Это универсальная метрика, которая позволяет сравнивать разные модели и тарифы. В среднем один токен соответствует примерно 4 символам английского текста или 0,75 слова. Для русского языка соотношение может отличаться из-за большего количества морфем.
Понимание токенов критически важно для:
- контроля расходов при использовании API;
- выбора подходящего тарифа ChatGPT;
- оптимизации промптов для получения полных ответов;
- работы с длинными документами, кодом или мультиязычными текстами.
Как работают лимиты токенов в ChatGPT: контекст и вывод
У каждой модели ChatGPT есть два ключевых ограничения: контекстное окно (context window) и максимальный вывод (max output tokens). Контекстное окно — это общий объём токенов, который модель может «видеть» за один запрос. В него входят:
- системная инструкция;
- история диалога;
- текущий вопрос пользователя;
- прикреплённые файлы или извлечённые фрагменты;
- внутренние токены рассуждений (для reasoning-моделей);
- сгенерированный ответ.
Максимальный вывод — это верхняя граница только для ответа модели. Например, у GPT-4o контекстное окно составляет 128 000 токенов, а максимальный вывод — 16 384 токена. Это означает, что если вы отправляете запрос с 120 000 токенов входа, на ответ остаётся всего 8 000 токенов, даже если лимит вывода выше.
У моделей GPT-5.6 (Sol, Terra, Luna) контекстное окно достигает 1 050 000 токенов, а максимальный вывод — 128 000 токенов. Это позволяет обрабатывать целые книги или большие кодовые базы за один раз, но требует аккуратного распределения бюджета токенов между входом и выходом.
Лимиты токенов по тарифам ChatGPT: Free, Plus, Pro
Лимиты токенов в веб-версии ChatGPT зависят от подписки и выбранного режима ответа.
Free и Go — базовая модель GPT-5.6 Luna без ручного выбора режима рассуждений. Контекстное окно не фиксируется в документации, но обычно ограничено 32K токенов для стандартных чатов. Кнопка «Think» также использует Luna.
Plus — модель GPT-5.6 Sol. В режиме Instant (мгновенный ответ) контекст — 32K токенов. При ручном выборе Medium или High контекст расширяется до 256K токенов, разделённых на 128K входа и 128K максимального вывода.
Pro — GPT-5.6 Sol и GPT-5.6 Sol Pro. Instant-режим даёт 128K токенов. Ручной выбор Medium, High, Extra High или Pro увеличивает контекст до 400K токенов (272K входа + 128K вывода).
Важно: лимиты на количество сообщений (message limits) существуют отдельно от токенов. Например, на тарифе Plus есть квота на количество запросов с рассуждением в единицу времени. Когда она исчерпана, ChatGPT может автоматически переключиться на более лёгкую модель (GPT-5.4 Thinking mini), но это не связано с переполнением контекстного окна.
Лимиты токенов в OpenAI API: модели и их возможности
При работе через API лимиты строго привязаны к конкретной модели. Вот ключевые модели и их характеристики:
- GPT-5.6 Sol / Terra / Luna: контекст 1 050 000 токенов, максимальный вывод 128 000 токенов. Различаются только ценой и производительностью.
- GPT-4.1: контекст 1 047 576 токенов, вывод до 32 768 токенов.
- GPT-4o: контекст 128 000 токенов, вывод до 16 384 токенов.
- GPT-4o mini: те же 128K контекста и 16K вывода, но дешевле.
Обратите внимание: устаревшие модели (GPT-4 Turbo, GPT-3.5 Turbo) имеют значительно меньшие лимиты и больше не рекомендуются к использованию.
В API также действуют rate limits — ограничения на количество запросов и токенов в минуту/день. Они не влияют на размер одного запроса, но могут блокировать слишком частые обращения. Повысить rate limits можно через увеличение usage tier.
Контекстное окно vs максимальный вывод: в чём разница
Эти два понятия часто путают, но их различие принципиально для практической работы.
Контекстное окно — это «рабочая память» модели. В неё помещается всё, что модель «видит»: инструкция, история, файлы, текущий вопрос и будущий ответ. Если сумма всех этих элементов превышает размер окна, запрос будет отклонён или обрезан.
Максимальный вывод — это ограничение только на сгенерированный текст. Модель может иметь окно в миллион токенов, но выводить не более 128 000 токенов за один раз.
Пример: у GPT-4.1 контекст — 1 047 576 токенов, а вывод — 32 768. Если вы загрузите документ на 1 000 000 токенов и попросите пересказ, модель сможет «прочитать» весь документ, но ответ будет ограничен 32 768 токенами. Если же вы загрузите 1 040 000 токенов, на ответ останется всего 7 576 токенов — меньше лимита вывода.
Для reasoning-моделей (GPT-5.6 Sol с высоким уровнем рассуждений) часть бюджета вывода тратится на внутренние «токены размышлений». Они не видны пользователю, но уменьшают доступное место для финального ответа. В API это контролируется параметром max_output_tokens, который ограничивает сумму токенов рассуждений и видимого текста.
Как токены расходуются на разные типы контента
Скорость расхода токенов зависит от языка и формата данных. Английский текст в среднем занимает 1 токен на 4 символа. Русский текст из-за большего количества букв и морфем может расходовать токены быстрее — примерно 1 токен на 2-3 символа.
Код и структурированные данные (JSON, XML, таблицы) часто требуют больше токенов на символ из-за частых пробелов, отступов и специальных символов. Например, строка print("Hello") может занять 5-6 токенов, хотя содержит всего 14 символов.
URL-адреса и длинные числа также могут разбиваться на несколько токенов. Эмодзи и редкие символы обычно занимают 1-2 токена.
При загрузке файлов в ChatGPT действуют отдельные лимиты:
- максимальный размер файла — 512 МБ;
- текстовые и документные файлы — до 2 миллионов токенов на файл;
- изображения — до 20 МБ;
- частота загрузки — до 80 файлов каждые 3 часа (может снижаться в пиковые периоды);
- бесплатный тариф — 3 загрузки в день.
Важно: лимит на токены файла не увеличивает контекстное окно. Если файл содержит 2 млн токенов, а контекст модели — 128K, то в ответ будет использована только часть файла.
Практические примеры расчёта токенов
Рассмотрим несколько сценариев, чтобы понять, как работают лимиты на практике.
Сценарий 1: Анализ длинного PDF в ChatGPT Plus Вы загружаете PDF объёмом 150 000 токенов и задаёте вопрос. В режиме Instant (32K контекста) модель не сможет обработать весь файл — запрос будет обрезан. Решение: переключиться на Medium или High (256K контекста), где файл поместится целиком, и задать вопрос. Ответ будет ограничен 128K токенов, но для краткого анализа этого достаточно.
Сценарий 2: Генерация кода через API Вы отправляете промпт с 500 000 токенов кода и просите рефакторинг. Модель GPT-5.6 Sol с окном 1 050 000 токенов примет запрос. Однако из 128 000 токенов вывода часть уйдёт на рассуждения (если включено reasoning). Чтобы получить полный рефакторинг, лучше разбить задачу на части.
Сценарий 3: Работа с историей диалога В длинном чате на 200 сообщений история может занимать 80 000 токенов. Если вы используете GPT-4o (128K контекста), на новый вопрос и ответ остаётся 48 000 токенов. Если история становится слишком большой, ChatGPT автоматически сжимает её (compaction), удаляя старые сообщения.
Для точного подсчёта токенов используйте токенизатор OpenAI (например, через библиотеку tiktoken). Он покажет, сколько токенов занимает ваш текст до отправки запроса.
Как оптимизировать использование токенов: советы и стратегии
Эффективное управление токенами помогает сэкономить деньги (при работе через API) и получить более полные ответы.
- Удаляйте дублирующиеся инструкции и лишние примеры. Каждый повторяющийся элемент съедает токены без пользы.
- Разбивайте длинные документы на разделы. Вместо загрузки целой книги загружайте только нужные главы или страницы.
- Используйте ретривер (RAG) для извлечения релевантных фрагментов. Вместо того чтобы помещать весь контекст в промпт, получайте только те части, которые относятся к вопросу.
- Сокращайте историю диалога. Вместо полной переписки передавайте краткое резюме предыдущих обсуждений.
- Резервируйте место для рассуждений. Если вы используете reasoning-модель, оставляйте в бюджете вывода запас для внутренних токенов.
- Генерируйте длинные отчёты по частям. Вместо одного огромного ответа запрашивайте разделы последовательно.
- Используйте модель с подходящими лимитами. Для коротких задач достаточно GPT-4o mini, для анализа больших документов — GPT-5.6 Sol.
- Фиксируйте версию модели в production. Используйте конкретный снэпшот (например,
gpt-5.6-sol-YYYY-MM-DD), чтобы избежать неожиданных изменений лимитов.
В API также доступны функции prompt caching (кэширование повторяющихся префиксов промпта) и batch processing (пакетная обработка), которые снижают стоимость за счёт повторного использования токенов.
Ограничения и подводные камни: что нужно знать
Даже при правильном расчёте токенов есть несколько важных нюансов.
Reasoning-токены не видны, но занимают место. В API параметр max_output_tokens ограничивает сумму токенов рассуждений и видимого ответа. Если модель исчерпала бюджет до завершения ответа, вы получите неполный результат с пометкой max_output_tokens. Всегда проверяйте объект usage в ответе, чтобы видеть реальное распределение.
Лимиты сообщений не равны лимитам токенов. Даже если в текущем диалоге мало токенов, вы можете упереться в квоту на количество запросов в час. Это особенно актуально для тарифов Plus и Pro при использовании режимов рассуждений.
Файлы не расширяют контекст. Загрузка файла на 2 млн токенов не увеличивает контекстное окно. Модель обработает только ту часть, которая помещается в окно вместе с историей и инструкцией.
Региональные надбавки. Для моделей, выпущенных после 5 марта 2026 года, при обработке в дата-центрах за пределами США может взиматься наценка 10%.
Устаревшие модели. GPT-4 и GPT-3.5 Turbo больше не поддерживаются. Их лимиты (8K и 16K соответственно) значительно ниже современных, и использовать их не рекомендуется.
Вопросы и ответы
Сколько токенов в одном русском слове?
В среднем одно русское слово занимает 1,5–2 токена из-за большего количества букв и морфем. Например, слово «токенизация» может быть разбито на 3 токена. Для точного подсчёта используйте токенизатор OpenAI (библиотека tiktoken).
Что будет, если превысить лимит токенов в ChatGPT?
Если запрос превышает контекстное окно, модель либо обрезает входные данные (теряя часть информации), либо возвращает ошибку. В веб-версии ChatGPT при переполнении контекста старые сообщения автоматически сжимаются или удаляются. В API запрос с превышением лимита будет отклонён.
Чем отличается контекстное окно от максимального вывода?
Контекстное окно — это общий объём токенов, который модель может обработать за один запрос (включая вход и выход). Максимальный вывод — это ограничение только на сгенерированный ответ. Например, у GPT-5.6 Sol окно 1 050 000 токенов, а вывод — 128 000 токенов.
Как узнать, сколько токенов занимает мой текст?
Используйте официальный токенизатор OpenAI (доступен через библиотеку tiktoken для Python) или онлайн-инструменты. В API ответ включает объект usage, где указано количество токенов в промпте, в ответе и общее число.
Влияют ли токены рассуждений на лимит вывода?
Да, токены, потраченные моделью на внутренние рассуждения, входят в бюджет max_output_tokens. Если вы установили лимит 128 000 токенов, а модель использовала 50 000 на рассуждения, на видимый ответ останется 78 000 токенов. При переполнении бюджета ответ будет неполным.
Можно ли увеличить контекстное окно ChatGPT?
Контекстное окно фиксировано для каждой модели и тарифа. Вы можете выбрать модель с большим окном (например, GPT-5.6 Sol с 1 050 000 токенов) или использовать ручной режим рассуждений на Plus/Pro для расширения до 256K–400K токенов. Увеличить окно сверх спецификации модели нельзя.
Что делать, если ответ ChatGPT обрывается из-за лимита токенов?
Попросите модель продолжить с того места, где она остановилась, или разбейте задачу на несколько запросов. В API увеличьте параметр max_output_tokens, если позволяет модель. Для длинных документов используйте модель с большим контекстным окном и резервируйте достаточно места для ответа.