Обновлено: 13 июля 2026
Идея кейса простая: типовой чат-бот поддержки отвечает флагманской моделью на все запросы подряд, хотя большинство обращений — «где мой заказ» и «как сменить тариф». Мы посчитали, что произойдёт со счётом за токены, если развести трафик по трём уровням моделей. Спойлер: при заданных допущениях затраты снижаются с 284 618 ₽ до 89 655 ₽ в месяц — до 31,5% от исходных, то есть на 68,5%.
01. Исходная задача
Условный SaaS-сервис держит чат-бот первой линии поддержки:
- 50 000 диалогов в месяц;
- средний диалог: 6 000 входных токенов (системный промпт, история, фрагменты базы знаний) и 1 200 выходных;
- итого в месяц: 300 млн входных и 60 млн выходных токенов;
- все запросы обслуживает флагман GPT-5.6 Sol.
Оплата официальных API из России ограничена, поэтому считаем по ценам прокси-сервисов. Минимальные цены на все нужные модели в наших данных — у BotHub: наценка к официальному тарифу +12,5%. Для сравнения: напрямую у OpenAI тот же трафик на Sol стоил бы 252 992,40 ₽ в месяц, через BotHub — 284 617,80 ₽.
Задача: снизить расходы, не трогая сам продукт — меняем только то, какая модель отвечает на какой запрос.
02. Архитектура: было и стало
Было — монолит. Пользователь → один системный промпт → GPT-5.6 Sol для 100% запросов → ответ. Флагман тратится и на разбор инцидента, и на вопрос «как выйти из аккаунта».
Стало — роутинг на три уровня. Пользователь → классификатор запроса (правила + лёгкая модель) → одна из трёх веток:
- типовые запросы → лёгкая модель GPT-5.6 Luna;
- средние → рабочая модель GPT-5.6 Terra;
- сложные → флагман GPT-5.6 Sol.
Плюс обязательная страховка: если лёгкая модель не справилась (низкая уверенность, повторный вопрос пользователя, явное «позови человека»), диалог эскалируется на уровень выше.
03. Что изменили
- Классификация запросов. Каждое обращение получает класс сложности до того, как уйдёт в основную модель. Подойдут эвристики (длина, ключевые слова, раздел продукта) или дешёвая LLM: роутер на DeepSeek V4 Flash при 500 входных и 20 выходных токенах на классификацию обойдётся примерно в 179 ₽ в месяц на весь поток — в расчёте ниже этой суммой пренебрегаем.
- Три уровня моделей вместо одного. Один и тот же промпт-шаблон, разные модели: Luna, Terra, Sol.
- Правила эскалации. Ошибка классификатора не должна стоить клиента: сомнительные случаи всегда уходят на уровень выше.
04. Маршрутизация запросов
Доли классов — допущение кейса, основанное на типовой структуре обращений первой линии; вашу реальную структуру покажет только разметка собственных диалогов.
| Класс запроса | Примеры | Модель | Доля | Цена диалога* |
|---|---|---|---|---|
| Типовые | FAQ, статусы заказов, навигация по продукту | GPT-5.6 Luna | 70% | 1,14 ₽ |
| Средние | Настройки, биллинг, ошибки по инструкции | GPT-5.6 Terra | 25% | 2,85 ₽ |
| Сложные | Инциденты, разбор логов, нестандартные случаи | GPT-5.6 Sol | 5% | 5,69 ₽ |
| Средневзвешенно | 100% | 1,79 ₽ |
* При профиле 6 000 входных + 1 200 выходных токенов, по ценам BotHub. Для сравнения: диалог целиком на Sol стоит 5,69 ₽.
05. Динамика стоимости
Цены, по которым считаем (BotHub, минимальные в нашем каталоге на 12–13.07.2026, ₽ за 1 млн токенов, вход / выход): Sol — 431,24 / 2 587,43; Terra — 215,62 / 1 293,72; Luna — 86,25 / 517,49.
| Уровень | Диалогов | Токены вход/выход, млн | Стоимость, ₽/мес | Доля затрат |
|---|---|---|---|---|
| Лёгкий (Luna) | 35 000 | 210 / 42 | 39 847,08 | 44,4% |
| Средний (Terra) | 12 500 | 75 / 15 | 35 577,30 | 39,7% |
| Флагман (Sol) | 2 500 | 15 / 3 | 14 230,89 | 15,9% |
| Итого «стало» | 50 000 | 300 / 60 | 89 655,27 | 100% |
| Было: всё на Sol | 50 000 | 300 / 60 | 284 617,80 | — |
| Экономия | 194 962,53 в месяц (−68,5%) |
Средняя стоимость диалога падает с 5,69 ₽ до 1,79 ₽. В годовом выражении экономия — около 2,34 млн ₽. Обратите внимание на структуру «стало»: 5% сложных диалогов съедают 15,9% бюджета — флагман дорог даже в малых дозах.
Вариант с Claude Haiku 4.5 на лёгком уровне (у неё дешевле выход: 86,25 / 431,24 ₽ за 1 млн через BotHub): диалог — 1,03 ₽, месяц целиком — 86 032,77 ₽, экономия 198 585,03 ₽ (−69,8%). Разница с Luna невелика; выбирать стоит по качеству ответов на вашем трафике, а не по этим копейкам.
06. Качество ответов: риски и контроль
Здесь честность важнее красивых графиков: у нас нет данных о качестве, и в расчётном кейсе их быть не может. Утверждать «качество не упало» мы не будем — это проверяется только на вашем трафике. Что известно из практики маршрутизации и что с этим делать:
- Лёгкая модель хуже держит сложные случаи. Контроль: правила эскалации + классификатор, настроенный «сомневаешься — отправляй выше». Каждый лишний процент трафика на Terra вместо Luna стоит ~854 ₽ в месяц (500 диалогов × 1,71 ₽ разницы) — страховка дешёвая, закладывайте её смело.
- Ошибки маршрутизации. Контроль: ручная разметка выборки диалогов до запуска и регулярная проверка после; A/B-тест роутинга на 10% трафика перед полным включением.
- Незаметная деградация со временем. Контроль: метрики доли эскалаций, повторных обращений и оценок пользователей — в дашборд с первого дня.
Если после проверки окажется, что лёгкий уровень тянет только 50% трафика, а не 70%, — пересчитайте: экономия уменьшится, но не исчезнет.
07. Стек и модели
- Доступ к моделям — BotHub: OpenAI-совместимый API, все четыре модели кейса в одном аккаунте, оплата российскими картами. Подойдёт и другой прокси-сервис — пересчитайте на его цены.
- Роутер — эвристики или дешёвая LLM (DeepSeek V4 Flash, ~179 ₽/мес на классификацию всего потока), либо классический ML-классификатор на своей стороне.
- Модели по уровням: GPT-5.6 Luna (типовые) · GPT-5.6 Terra (средние) · GPT-5.6 Sol (сложные) · Claude Haiku 4.5 как альтернатива на лёгком уровне.
- Наблюдаемость: логирование класса запроса, модели, токенов и стоимости на каждый диалог — без этого экономику не проверить.
08. План внедрения (типовой, 6 недель)
- Недели 1–2 — аудит. Выгрузка и разметка выборки диалогов, реальная структура классов, базовые метрики стоимости.
- Неделя 3 — роутер MVP. Классификатор и правила, прогон на исторических данных, A/B на 10% трафика.
- Неделя 4 — расширение. До 50% трафика, донастройка правил эскалации, сверка качества на выборке.
- Неделя 5 — 100% трафика. Полное включение, дашборд стоимости и эскалаций.
- Неделя 6 — финализация. Отчёт «план/факт» по экономии, плейбук на случай деградации, регулярный пересмотр цен.
Сроки ориентировочные: команде из двух инженеров с готовым ботом здесь работы на несколько спринтов, а не кварталов.
09. Ограничения результата
- Это расчёт, а не измерение. Ни один из показателей не наблюдался в проде; реальный эффект зависит от вашей структуры трафика и качества роутинга.
- Цены зафиксированы на 12–13 июля 2026 года и меняются: и официальные тарифы, и наценки прокси. Перед решением сверьтесь с актуальными ценами в каталоге.
- Комиссии не учтены: пополнение баланса, комиссии платёжных систем и НДС могут добавить к итогу; считали только стоимость токенов по тарифам BotHub.
- Профиль токенов одинаков для всех уровней (6 000 + 1 200). В реальности типовые диалоги обычно короче сложных, так что по лёгкому уровню оценка скорее консервативная, по флагманскому — заниженная.
- Сплит 70/25/5 — допущение. Стоимость классификации мы исключили из итога (~179 ₽/мес при роутере на DeepSeek V4 Flash), затраты на разработку и качество ответов — за рамками расчёта.
10. Методика расчётов
Формула одна: стоимость диалога = (входные токены × цена входа + выходные токены × цена выхода) / 1 000 000, месяц = сумма по всем диалогам. Пример для Sol: 6 000 × 431,24 / 10⁶ + 1 200 × 2 587,43 / 10⁶ = 2,59 + 3,10 = 5,69 ₽. «Было» = 50 000 × 5,692356 = 284 617,80 ₽. «Стало» = 35 000 × 1,138488 + 12 500 × 2,846184 + 2 500 × 5,692356 = 39 847,08 + 35 577,30 + 14 230,89 = 89 655,27 ₽. Все промежуточные значения считались без округления; округляли только при выводе. Цены — минимальные среди прокси-сервисов нашего каталога (методика сбора — на отдельной странице).
11. Воспроизводимость
Подставьте свои цифры — число диалогов, профиль токенов, доли классов — в калькулятор стоимости: он считает по актуальным ценам каталога, а не по снимку из этого кейса. Если ваш сплит трафика другой, экономика изменится, но формула та же.
12. Связанные модели и сервисы
Модели кейса: GPT-5.6 Sol · GPT-5.6 Terra · GPT-5.6 Luna · Claude Haiku 4.5 · DeepSeek V4 Flash. Цены в расчёте — BotHub; альтернативные прокси и их наценки — в каталоге сервисов. Как выбрать прокси под себя — в гайде «Как выбрать API-прокси».
13. Итоги и выводы
Главный вывод не в конкретных процентах, а в асимметрии: маршрутизация — недели работы и копеечный роутер, а разница в цене между лёгкой моделью и флагманом — пятикратная. Даже если у вас типовых запросов вдвое меньше, чем в нашем допущении, счёт за токены всё равно сожмётся заметно. Начните с разметки сотни своих диалогов — дальше арифметика сделает всё сама.