Обновлено: 14 июля 2026
Токен — это фрагмент текста, которым нейросеть измеряет и ваш запрос, и свой ответ; за каждый токен вы платите. Тариф любой модели состоит из двух ставок — за входные токены и за выходные, обе указываются за 1 млн штук. Чтобы оценить стоимость запроса, достаточно знать объём входа, примерный объём выхода и тарифы конкретной модели — актуальные собраны в наших таблицах моделей. Разберём каждую часть этой арифметики.
Токен — это кусок слова
Модель не оперирует ни буквами, ни целыми словами. Перед обработкой текст проходит через токенизатор — алгоритм, который режет строку на фрагменты из заранее составленного словаря. Самый распространённый подход называется BPE, byte pair encoding: словарь собирается из наиболее частых сочетаний символов в обучающих данных.
Частые английские слова обычно попадают в словарь целиком и занимают один токен, а редкие — разваливаются на несколько кусков. Русского текста в обучающих корпусах, как правило, меньше, чем английского, а наши слова длиннее и меняются по падежам — поэтому на тот же смысл по-русски обычно уходит больше токенов, чем по-английски.
Точного коэффициента «во сколько раз больше» не существует: результат зависит от токенизатора конкретной модели и от самого текста. Надёжнее один раз измерить свой реальный промпт. Код для этого не нужен: у AITunnel есть публичный токенайзер на странице aitunnel.ru/tokenizer — вставляете текст и видите число токенов.
Область применения этой арифметики — текстовые API: там токены служат единицей тарификации и у официальных платформ, и у сервисов доступа из России; прокси меняет ставку за миллион токенов, но не принцип подсчёта. За пределами текста единицы другие — генерации у картинок, секунды у видео, а подписочные сервисы считают запросы или внутреннюю валюту.
Почему вход и выход тарифицируются отдельно
Входные токены — всё, что вы отправляете модели: системная инструкция, сам вопрос, история диалога, приложенные документы. Выходные — то, что модель генерирует в ответ. У большинства моделей выход дороже входа, порой в разы — но не у всех: например, у YandexGPT и GigaChat вход и выход стоят одинаково, поэтому обе ставки сверяйте по таблице своей модели.
Одна из причин разницы — механика работы. Вход модель обрабатывает одним проходом, а ответ выдаёт последовательно, токен за токеном, и каждый следующий токен требует отдельного вычисления. Впрочем, итоговое соотношение ставок каждый вендор задаёт сам — тарифная политика тут не менее важна, чем вычисления.
Практический вывод: длинный ответ бьёт по бюджету сильнее длинного вопроса. Если задаче хватает короткого ответа — попросите модель отвечать сжато или ограничьте генерацию параметром max_tokens. Экономия на выходе заметнее экономии на входе.
Контекстное окно: сколько модель «видит» за раз
Контекстное окно — максимальный объём токенов, который модель удерживает в одном запросе; обычно он считается на вход и выход суммарно, но у части моделей есть отдельный предел на длину ответа — сверьте в документации своей. Размеры окна различаются в разы даже внутри нашего каталога. У Claude Opus 4.8 окно — 1 000 000 токенов, у DeepSeek V3.2 — 131 072. Между ними — целый спектр: скажем, у GPT-5.4 mini — 400 000, у Claude Haiku 4.5 — 200 000.
Миллион токенов — это целые книги или заметная часть репозитория кода в одном запросе. Но большое окно не означает дешевизну, скорее наоборот. Каждый токен в окне оплачивается как входной: отправили документ на сотни тысяч токенов — счёт вырос пропорционально.
Отдельная ловушка — чаты. История переписки отправляется модели заново с каждым сообщением, то есть за одни и те же токены вы платите многократно. Чем длиннее диалог, тем дороже каждое следующее сообщение — это стоит учитывать при проектировании ботов.
Формула: считаем стоимость запроса
Стоимость одного запроса складывается из двух слагаемых:
стоимость = (вход_токены × цена_входа + выход_токены × цена_выхода) / 1 000 000
Делитель появляется потому, что обе цены указываются за 1 млн токенов. Подставлять конкретные цифры цен здесь не будем: они меняются, а статья — нет. Актуальные тарифы каждой модели и наценки сервисов доступа — в таблицах моделей, например у GPT-5.5.
Алгоритм оценки из трёх шагов:
- Посчитайте вход. Прогоните типовой промпт через токенайзер — публичный есть у AITunnel. Не забудьте системную инструкцию и историю диалога, если она есть.
- Оцените выход. Точно предсказать его нельзя, но рамку задаёт
max_tokensили ваш опыт: типовой ответ чат-бота — сотни токенов, развёрнутый разбор — тысячи. - Подставьте тарифы из таблицы модели и умножьте результат на ожидаемое число запросов в месяц.
Разберём на условных объёмах, без цен. Пусть системная инструкция бота занимает 800 токенов, вопрос пользователя — 200, типовой ответ — 600. Вход — 1 000 токенов, выход — 600; умножаете каждую часть на свою ставку из таблицы модели, складываете и делите на миллион. Дальше остаётся умножить на суточный трафик — и бюджет месяца перестаёт быть сюрпризом.
Проверить оценку легко по факту. OpenAI-совместимые API — такой формат у VseGPT, ProxyAPI и других сервисов каталога — возвращают в ответе блок usage с числом входных и выходных токенов. Набор полей и учёт кэшированных или служебных токенов у сервисов различаются, поэтому первую неделю сверяйте usage и со своим прогнозом, и со списаниями в кабинете — дальше расходы станут предсказуемыми.
Что раздувает счёт незаметно
Чаще всего скрытый расход создают три вещи. Первая — системный промпт: он уходит с каждым запросом, и лишняя тысяча токенов инструкций при большом трафике превращается в ощутимую статью расходов. Вторая — история диалога, о которой сказано выше. Третья — документы: объёмный PDF в промпте может стоить больше токенов, чем весь остальной трафик бота за день.
Если объёмы большие, посмотрите на функции экономии у сервисов доступа: например, ProxyAPI заявляет Batch API и кэширование со скидкой к обычной ставке. Как сравнивать сервисы по этим параметрам — в чеклисте по выбору API-прокси.
Самый же мощный рычаг экономии — сама модель. Ставки за миллион токенов у флагманов и бюджетных моделей различаются на порядки, поэтому перенос массовых простых задач на класс ниже даёт больше, чем любая оптимизация промпта. Какой класс под какую задачу — в гиде по выбору модели.
Вопросы и ответы
Сколько токенов занимает одно русское слово?
Универсального коэффициента нет: всё зависит от токенизатора модели и конкретного текста. Общий принцип один — русский текст режется на большее число токенов, чем английский с тем же смыслом. Точную цифру для вашего промпта покажет токенайзер, например публичный у AITunnel.
Почему выходные токены дороже входных?
Вход модель обрабатывает одним проходом, а ответ генерирует последовательно, токен за токеном, — это вычислительно дороже. Но правило не универсально: у большинства моделей каталога выход дороже входа в несколько раз, а, например, у YandexGPT и GigaChat ставки одинаковые — сверяйте таблицу своей модели.
Что произойдёт, если превысить контекстное окно?
API вернёт ошибку — запрос не поместится в модель. Многие чат-клиенты в этой ситуации обрезают или сжимают старую историю, из-за чего длинный диалог «забывает» начало; точное поведение зависит от клиента. Для больших документов выбирайте модели с запасом: у Claude Opus 4.8 окно — 1 000 000 токенов.
Токены разных моделей — одно и то же?
Нет, у каждого семейства моделей свой токенизатор и словарь. Один и тот же текст у разных моделей даст разное число токенов. Поэтому сравнивать тарифы честнее на своём реальном промпте, а не только по ставкам за миллион.
Где смотреть актуальные цены за токены?
В таблицах нашего каталога: страница все модели и карточки конкретных моделей. Там собраны официальные тарифы и цены сервисов доступа с датой обновления у каждой цифры; как мы их считаем — в методике.