Обновлено: 7 сентября 2026

Токен — это фрагмент текста, которым нейросеть измеряет и ваш запрос, и свой ответ; за каждый токен вы платите. Тариф любой модели состоит из двух ставок — за входные токены и за выходные, обе указываются за 1 млн штук. Чтобы оценить стоимость запроса, достаточно знать объём входа, примерный объём выхода и тарифы конкретной модели — актуальные собраны в наших таблицах моделей. Разберём каждую часть этой арифметики.

Токен — это кусок слова

Модель не оперирует ни буквами, ни целыми словами. Перед обработкой текст проходит через токенизатор — алгоритм, который режет строку на фрагменты из заранее составленного словаря. Самый распространённый подход называется BPE, byte pair encoding: словарь собирается из наиболее частых сочетаний символов в обучающих данных.

Частые английские слова обычно попадают в словарь целиком и занимают один токен, а редкие — дробятся на несколько частей. Русского текста в обучающих корпусах меньше, чем английского, а наши слова длиннее и меняются по падежам — поэтому на тот же смысл по-русски уходит больше токенов, чем по-английски.

Точного коэффициента «во сколько раз больше» не существует: результат зависит от токенизатора конкретной модели и от самого текста. Надёжнее один раз измерить свой реальный промпт. Код для этого не нужен: у AITunnel есть публичный токенизатор на странице aitunnel.ru/tokenizer — вставляете текст и видите число токенов.

Эта арифметика работает для текстовых API: там токены служат единицей тарификации и у официальных платформ, и у сервисов доступа из России; прокси меняет ставку за миллион токенов, но не принцип подсчёта. За пределами текста единицы другие — генерации у картинок, секунды у видео, а подписочные сервисы считают запросы или внутреннюю валюту.

Почему вход и выход тарифицируются отдельно

Входные токены — всё, что вы отправляете модели: системная инструкция, сам вопрос, история диалога, приложенные документы. Выходные — то, что модель генерирует в ответ. У большинства моделей выход дороже входа, порой в разы — но не у всех: например, у YandexGPT и GigaChat вход и выход стоят одинаково, поэтому обе ставки сверяйте по таблице своей модели.

Одна из причин разницы — механика работы. Вход модель обрабатывает одним проходом, а ответ выдаёт последовательно, токен за токеном, и каждый следующий токен требует отдельного вычисления. Впрочем, итоговое соотношение ставок каждый разработчик модели задаёт сам — тарифная политика тут не менее важна, чем вычисления.

Практический вывод: длинный ответ бьёт по бюджету сильнее длинного вопроса. Если задаче хватает короткого ответа — попросите модель отвечать сжато или ограничьте генерацию параметром max_tokens. Экономия на выходе заметнее экономии на входе.

Контекстное окно: сколько модель «видит» за раз

Контекстное окно — максимальный объём токенов, который модель удерживает в одном запросе; обычно он считается на вход и выход суммарно, но у части моделей есть отдельный предел на длину ответа — сверьте в документации своей модели.

Размеры окна различаются в разы даже внутри нашего каталога. У Claude Opus 5 окно — 1 000 000 токенов, у Kimi K2 — 131 072. Между ними — целый спектр: у Claude Haiku 4.5 — 200 000, у GPT-5.4 mini — 400 000. Миллионное окно перестало быть привилегией старших моделей: у бюджетной GPT-5.6 Luna — 1 050 000.

Миллион токенов — это целые книги или заметная часть репозитория кода в одном запросе. Но большое окно не означает дешевизну, скорее наоборот. Каждый токен в окне оплачивается как входной: отправили документ на сотни тысяч токенов — счёт вырос пропорционально.

Отдельная ловушка — чаты. История переписки отправляется модели заново с каждым сообщением, то есть за одни и те же токены вы платите многократно. Чем длиннее диалог, тем дороже каждое следующее сообщение — это надо закладывать в расчёт, когда проектируете бота.

Как посчитать стоимость запроса

Стоимость одного запроса складывается из двух слагаемых:

стоимость = (вход_токены × цена_входа + выход_токены × цена_выхода) / 1 000 000

Делитель появляется потому, что обе цены указываются за 1 млн токенов. Подставлять конкретные цифры цен здесь не будем: они меняются, а статья — нет. Актуальные тарифы каждой модели и наценки сервисов доступа — в таблицах моделей, например у GPT-5.6 Terra.

Алгоритм оценки из трёх шагов:

  1. Посчитайте вход. Прогоните типовой промпт через токенизатор — публичный есть у AITunnel. Не забудьте системную инструкцию и историю диалога, если она есть.
  2. Оцените выход. Точно предсказать его нельзя, но рамку задаёт max_tokens или ваш опыт: типовой ответ чат-бота — сотни токенов, развёрнутый разбор — тысячи.
  3. Подставьте тарифы из таблицы модели и умножьте результат на ожидаемое число запросов в месяц.

Разберём на условных объёмах, без цен. Пусть системная инструкция бота занимает 800 токенов, вопрос пользователя — 200, типовой ответ — 600. Вход — 1 000 токенов, выход — 600; умножаете каждую часть на свою ставку из таблицы модели, складываете и делите на миллион. Дальше остаётся умножить на суточный трафик — и бюджет месяца перестаёт быть сюрпризом.

Оценку легко проверить фактом. OpenAI-совместимые API — такой формат у VseGPT, ProxyAPI и других сервисов каталога — возвращают в ответе блок usage с числом входных и выходных токенов. Набор полей и учёт кэшированных или служебных токенов у сервисов различаются, поэтому первую неделю сверяйте usage и со своим прогнозом, и со списаниями в кабинете — дальше расходы станут предсказуемыми.

Схема: входные и выходные токены тарифицируются отдельно, сумма делится на миллион
Вход и выход считаются по разным ставкам за 1 млн токенов — отсюда и формула

Что раздувает счёт незаметно

Чаще всего скрытый расход создают три источника. Первый — системный промпт: он уходит с каждым запросом, и лишняя тысяча токенов инструкций при большом трафике превращается в ощутимую статью расходов. Второй — история диалога, о которой сказано выше. Третий — документы: объёмный PDF в промпте может стоить больше токенов, чем весь остальной трафик бота за день.

Против первого и третьего источника работает кэширование промптов: повторяющуюся часть запроса — системный промпт, большой документ — разработчик модели запоминает и при следующем обращении берёт за неё сниженную ставку чтения кэша. Разница между моделями тут заметная: у Claude Fable 5.1 чтение кэша вчетверо дешевле, чем у предыдущей Fable 5, при той же цене за обычные токены. Доходит ли эта скидка до покупателя у российского сервиса, сверяйте по его документации: например, ProxyAPI заявляет Batch API и кэширование со скидкой к обычной ставке, а в наших таблицах такого поля нет. Как сравнивать сервисы по этим параметрам — в чеклисте по выбору API-прокси.

Сильнее же всего на счёт влияет сама модель. Ставки за миллион токенов у флагманов и бюджетных моделей различаются на порядки, поэтому перенос массовых простых задач на класс ниже даёт больше, чем любая оптимизация промпта. Какой класс под какую задачу — в гайде по выбору модели.

Вопросы и ответы

Сколько токенов занимает одно русское слово?

Универсального коэффициента нет: всё зависит от токенизатора модели и конкретного текста. Общий принцип один — русский текст делится на большее число токенов, чем английский с тем же смыслом. Точную цифру для вашего промпта покажет токенизатор, например публичный у AITunnel.

Почему выходные токены дороже входных?

Вход модель обрабатывает одним проходом, а ответ генерирует последовательно, токен за токеном, — это вычислительно дороже. Но правило не универсально: у большинства моделей каталога выход дороже входа в несколько раз, а, например, у YandexGPT и GigaChat ставки одинаковые — сверяйте таблицу своей модели.

Что произойдёт, если превысить контекстное окно?

API вернёт ошибку — запрос не поместится в контекстное окно. Многие чат-клиенты в этой ситуации обрезают или сжимают старую историю, из-за чего длинный диалог «забывает» начало; точное поведение зависит от клиента. Для больших документов выбирайте модели с запасом: у Claude Opus 5 окно — 1 000 000 токенов.

Токены разных моделей — одно и то же?

Нет, у каждого семейства моделей свой токенизатор и словарь. Один и тот же текст у разных моделей даст разное число токенов. Поэтому сравнивать тарифы точнее на своём реальном промпте, а не только по ставкам за миллион.

Где смотреть актуальные цены за токены?

В таблицах нашего каталога: страница все модели и карточки конкретных моделей. Там собраны официальные тарифы и цены сервисов доступа с датой обновления у каждой цифры; как мы их считаем — в методике.