Обновлено: 14 июля 2026

Токен — это фрагмент текста, которым нейросеть измеряет и ваш запрос, и свой ответ; за каждый токен вы платите. Тариф любой модели состоит из двух ставок — за входные токены и за выходные, обе указываются за 1 млн штук. Чтобы оценить стоимость запроса, достаточно знать объём входа, примерный объём выхода и тарифы конкретной модели — актуальные собраны в наших таблицах моделей. Разберём каждую часть этой арифметики.

Токен — это кусок слова

Модель не оперирует ни буквами, ни целыми словами. Перед обработкой текст проходит через токенизатор — алгоритм, который режет строку на фрагменты из заранее составленного словаря. Самый распространённый подход называется BPE, byte pair encoding: словарь собирается из наиболее частых сочетаний символов в обучающих данных.

Частые английские слова обычно попадают в словарь целиком и занимают один токен, а редкие — разваливаются на несколько кусков. Русского текста в обучающих корпусах, как правило, меньше, чем английского, а наши слова длиннее и меняются по падежам — поэтому на тот же смысл по-русски обычно уходит больше токенов, чем по-английски.

Точного коэффициента «во сколько раз больше» не существует: результат зависит от токенизатора конкретной модели и от самого текста. Надёжнее один раз измерить свой реальный промпт. Код для этого не нужен: у AITunnel есть публичный токенайзер на странице aitunnel.ru/tokenizer — вставляете текст и видите число токенов.

Область применения этой арифметики — текстовые API: там токены служат единицей тарификации и у официальных платформ, и у сервисов доступа из России; прокси меняет ставку за миллион токенов, но не принцип подсчёта. За пределами текста единицы другие — генерации у картинок, секунды у видео, а подписочные сервисы считают запросы или внутреннюю валюту.

Почему вход и выход тарифицируются отдельно

Входные токены — всё, что вы отправляете модели: системная инструкция, сам вопрос, история диалога, приложенные документы. Выходные — то, что модель генерирует в ответ. У большинства моделей выход дороже входа, порой в разы — но не у всех: например, у YandexGPT и GigaChat вход и выход стоят одинаково, поэтому обе ставки сверяйте по таблице своей модели.

Одна из причин разницы — механика работы. Вход модель обрабатывает одним проходом, а ответ выдаёт последовательно, токен за токеном, и каждый следующий токен требует отдельного вычисления. Впрочем, итоговое соотношение ставок каждый вендор задаёт сам — тарифная политика тут не менее важна, чем вычисления.

Практический вывод: длинный ответ бьёт по бюджету сильнее длинного вопроса. Если задаче хватает короткого ответа — попросите модель отвечать сжато или ограничьте генерацию параметром max_tokens. Экономия на выходе заметнее экономии на входе.

Контекстное окно: сколько модель «видит» за раз

Контекстное окно — максимальный объём токенов, который модель удерживает в одном запросе; обычно он считается на вход и выход суммарно, но у части моделей есть отдельный предел на длину ответа — сверьте в документации своей. Размеры окна различаются в разы даже внутри нашего каталога. У Claude Opus 4.8 окно — 1 000 000 токенов, у DeepSeek V3.2 — 131 072. Между ними — целый спектр: скажем, у GPT-5.4 mini — 400 000, у Claude Haiku 4.5 — 200 000.

Миллион токенов — это целые книги или заметная часть репозитория кода в одном запросе. Но большое окно не означает дешевизну, скорее наоборот. Каждый токен в окне оплачивается как входной: отправили документ на сотни тысяч токенов — счёт вырос пропорционально.

Отдельная ловушка — чаты. История переписки отправляется модели заново с каждым сообщением, то есть за одни и те же токены вы платите многократно. Чем длиннее диалог, тем дороже каждое следующее сообщение — это стоит учитывать при проектировании ботов.

Формула: считаем стоимость запроса

Стоимость одного запроса складывается из двух слагаемых:

стоимость = (вход_токены × цена_входа + выход_токены × цена_выхода) / 1 000 000

Делитель появляется потому, что обе цены указываются за 1 млн токенов. Подставлять конкретные цифры цен здесь не будем: они меняются, а статья — нет. Актуальные тарифы каждой модели и наценки сервисов доступа — в таблицах моделей, например у GPT-5.5.

Алгоритм оценки из трёх шагов:

  1. Посчитайте вход. Прогоните типовой промпт через токенайзер — публичный есть у AITunnel. Не забудьте системную инструкцию и историю диалога, если она есть.
  2. Оцените выход. Точно предсказать его нельзя, но рамку задаёт max_tokens или ваш опыт: типовой ответ чат-бота — сотни токенов, развёрнутый разбор — тысячи.
  3. Подставьте тарифы из таблицы модели и умножьте результат на ожидаемое число запросов в месяц.

Разберём на условных объёмах, без цен. Пусть системная инструкция бота занимает 800 токенов, вопрос пользователя — 200, типовой ответ — 600. Вход — 1 000 токенов, выход — 600; умножаете каждую часть на свою ставку из таблицы модели, складываете и делите на миллион. Дальше остаётся умножить на суточный трафик — и бюджет месяца перестаёт быть сюрпризом.

Проверить оценку легко по факту. OpenAI-совместимые API — такой формат у VseGPT, ProxyAPI и других сервисов каталога — возвращают в ответе блок usage с числом входных и выходных токенов. Набор полей и учёт кэшированных или служебных токенов у сервисов различаются, поэтому первую неделю сверяйте usage и со своим прогнозом, и со списаниями в кабинете — дальше расходы станут предсказуемыми.

Что раздувает счёт незаметно

Чаще всего скрытый расход создают три вещи. Первая — системный промпт: он уходит с каждым запросом, и лишняя тысяча токенов инструкций при большом трафике превращается в ощутимую статью расходов. Вторая — история диалога, о которой сказано выше. Третья — документы: объёмный PDF в промпте может стоить больше токенов, чем весь остальной трафик бота за день.

Если объёмы большие, посмотрите на функции экономии у сервисов доступа: например, ProxyAPI заявляет Batch API и кэширование со скидкой к обычной ставке. Как сравнивать сервисы по этим параметрам — в чеклисте по выбору API-прокси.

Самый же мощный рычаг экономии — сама модель. Ставки за миллион токенов у флагманов и бюджетных моделей различаются на порядки, поэтому перенос массовых простых задач на класс ниже даёт больше, чем любая оптимизация промпта. Какой класс под какую задачу — в гиде по выбору модели.

Вопросы и ответы

Сколько токенов занимает одно русское слово?

Универсального коэффициента нет: всё зависит от токенизатора модели и конкретного текста. Общий принцип один — русский текст режется на большее число токенов, чем английский с тем же смыслом. Точную цифру для вашего промпта покажет токенайзер, например публичный у AITunnel.

Почему выходные токены дороже входных?

Вход модель обрабатывает одним проходом, а ответ генерирует последовательно, токен за токеном, — это вычислительно дороже. Но правило не универсально: у большинства моделей каталога выход дороже входа в несколько раз, а, например, у YandexGPT и GigaChat ставки одинаковые — сверяйте таблицу своей модели.

Что произойдёт, если превысить контекстное окно?

API вернёт ошибку — запрос не поместится в модель. Многие чат-клиенты в этой ситуации обрезают или сжимают старую историю, из-за чего длинный диалог «забывает» начало; точное поведение зависит от клиента. Для больших документов выбирайте модели с запасом: у Claude Opus 4.8 окно — 1 000 000 токенов.

Токены разных моделей — одно и то же?

Нет, у каждого семейства моделей свой токенизатор и словарь. Один и тот же текст у разных моделей даст разное число токенов. Поэтому сравнивать тарифы честнее на своём реальном промпте, а не только по ставкам за миллион.

Где смотреть актуальные цены за токены?

В таблицах нашего каталога: страница все модели и карточки конкретных моделей. Там собраны официальные тарифы и цены сервисов доступа с датой обновления у каждой цифры; как мы их считаем — в методике.