Обновлено: 13 июля 2026

Это модельный кейс, а не отчёт клиента. У нас нет заказчика с такими данными: сценарий условный, а все цены — реальные, из нашего каталога на 12–13 июля 2026 года. Мы не называем компаний, не приводим «результатов внедрения» и не обещаем, что качество ответов не изменится, — это расчёт экономики маршрутизации, который вы можете повторить на своих цифрах.

Идея кейса простая: типовой чат-бот поддержки отвечает флагманской моделью на все запросы подряд, хотя большинство обращений — «где мой заказ» и «как сменить тариф». Мы посчитали, что произойдёт со счётом за токены, если развести трафик по трём уровням моделей. Спойлер: при заданных допущениях затраты снижаются с 284 618 ₽ до 89 655 ₽ в месяц — до 31,5% от исходных, то есть на 68,5%.

01. Исходная задача

Условный SaaS-сервис держит чат-бот первой линии поддержки:

  • 50 000 диалогов в месяц;
  • средний диалог: 6 000 входных токенов (системный промпт, история, фрагменты базы знаний) и 1 200 выходных;
  • итого в месяц: 300 млн входных и 60 млн выходных токенов;
  • все запросы обслуживает флагман GPT-5.6 Sol.

Оплата официальных API из России ограничена, поэтому считаем по ценам прокси-сервисов. Минимальные цены на все нужные модели в наших данных — у BotHub: наценка к официальному тарифу +12,5%. Для сравнения: напрямую у OpenAI тот же трафик на Sol стоил бы 252 992,40 ₽ в месяц, через BotHub — 284 617,80 ₽.

Задача: снизить расходы, не трогая сам продукт — меняем только то, какая модель отвечает на какой запрос.

02. Архитектура: было и стало

Было — монолит. Пользователь → один системный промпт → GPT-5.6 Sol для 100% запросов → ответ. Флагман тратится и на разбор инцидента, и на вопрос «как выйти из аккаунта».

Стало — роутинг на три уровня. Пользователь → классификатор запроса (правила + лёгкая модель) → одна из трёх веток:

  • типовые запросы → лёгкая модель GPT-5.6 Luna;
  • средние → рабочая модель GPT-5.6 Terra;
  • сложные → флагман GPT-5.6 Sol.

Плюс обязательная страховка: если лёгкая модель не справилась (низкая уверенность, повторный вопрос пользователя, явное «позови человека»), диалог эскалируется на уровень выше.

03. Что изменили

  1. Классификация запросов. Каждое обращение получает класс сложности до того, как уйдёт в основную модель. Подойдут эвристики (длина, ключевые слова, раздел продукта) или дешёвая LLM: роутер на DeepSeek V4 Flash при 500 входных и 20 выходных токенах на классификацию обойдётся примерно в 179 ₽ в месяц на весь поток — в расчёте ниже этой суммой пренебрегаем.
  2. Три уровня моделей вместо одного. Один и тот же промпт-шаблон, разные модели: Luna, Terra, Sol.
  3. Правила эскалации. Ошибка классификатора не должна стоить клиента: сомнительные случаи всегда уходят на уровень выше.

04. Маршрутизация запросов

Доли классов — допущение кейса, основанное на типовой структуре обращений первой линии; вашу реальную структуру покажет только разметка собственных диалогов.

Класс запроса Примеры Модель Доля Цена диалога*
Типовые FAQ, статусы заказов, навигация по продукту GPT-5.6 Luna 70% 1,14 ₽
Средние Настройки, биллинг, ошибки по инструкции GPT-5.6 Terra 25% 2,85 ₽
Сложные Инциденты, разбор логов, нестандартные случаи GPT-5.6 Sol 5% 5,69 ₽
Средневзвешенно 100% 1,79 ₽

* При профиле 6 000 входных + 1 200 выходных токенов, по ценам BotHub. Для сравнения: диалог целиком на Sol стоит 5,69 ₽.

05. Динамика стоимости

Цены, по которым считаем (BotHub, минимальные в нашем каталоге на 12–13.07.2026, ₽ за 1 млн токенов, вход / выход): Sol — 431,24 / 2 587,43; Terra — 215,62 / 1 293,72; Luna — 86,25 / 517,49.

Уровень Диалогов Токены вход/выход, млн Стоимость, ₽/мес Доля затрат
Лёгкий (Luna) 35 000 210 / 42 39 847,08 44,4%
Средний (Terra) 12 500 75 / 15 35 577,30 39,7%
Флагман (Sol) 2 500 15 / 3 14 230,89 15,9%
Итого «стало» 50 000 300 / 60 89 655,27 100%
Было: всё на Sol 50 000 300 / 60 284 617,80
Экономия 194 962,53 в месяц (−68,5%)

Средняя стоимость диалога падает с 5,69 ₽ до 1,79 ₽. В годовом выражении экономия — около 2,34 млн ₽. Обратите внимание на структуру «стало»: 5% сложных диалогов съедают 15,9% бюджета — флагман дорог даже в малых дозах.

Вариант с Claude Haiku 4.5 на лёгком уровне (у неё дешевле выход: 86,25 / 431,24 ₽ за 1 млн через BotHub): диалог — 1,03 ₽, месяц целиком — 86 032,77 ₽, экономия 198 585,03 ₽ (−69,8%). Разница с Luna невелика; выбирать стоит по качеству ответов на вашем трафике, а не по этим копейкам.

06. Качество ответов: риски и контроль

Здесь честность важнее красивых графиков: у нас нет данных о качестве, и в расчётном кейсе их быть не может. Утверждать «качество не упало» мы не будем — это проверяется только на вашем трафике. Что известно из практики маршрутизации и что с этим делать:

  • Лёгкая модель хуже держит сложные случаи. Контроль: правила эскалации + классификатор, настроенный «сомневаешься — отправляй выше». Каждый лишний процент трафика на Terra вместо Luna стоит ~854 ₽ в месяц (500 диалогов × 1,71 ₽ разницы) — страховка дешёвая, закладывайте её смело.
  • Ошибки маршрутизации. Контроль: ручная разметка выборки диалогов до запуска и регулярная проверка после; A/B-тест роутинга на 10% трафика перед полным включением.
  • Незаметная деградация со временем. Контроль: метрики доли эскалаций, повторных обращений и оценок пользователей — в дашборд с первого дня.

Если после проверки окажется, что лёгкий уровень тянет только 50% трафика, а не 70%, — пересчитайте: экономия уменьшится, но не исчезнет.

07. Стек и модели

  • Доступ к моделямBotHub: OpenAI-совместимый API, все четыре модели кейса в одном аккаунте, оплата российскими картами. Подойдёт и другой прокси-сервис — пересчитайте на его цены.
  • Роутер — эвристики или дешёвая LLM (DeepSeek V4 Flash, ~179 ₽/мес на классификацию всего потока), либо классический ML-классификатор на своей стороне.
  • Модели по уровням: GPT-5.6 Luna (типовые) · GPT-5.6 Terra (средние) · GPT-5.6 Sol (сложные) · Claude Haiku 4.5 как альтернатива на лёгком уровне.
  • Наблюдаемость: логирование класса запроса, модели, токенов и стоимости на каждый диалог — без этого экономику не проверить.

08. План внедрения (типовой, 6 недель)

  • Недели 1–2 — аудит. Выгрузка и разметка выборки диалогов, реальная структура классов, базовые метрики стоимости.
  • Неделя 3 — роутер MVP. Классификатор и правила, прогон на исторических данных, A/B на 10% трафика.
  • Неделя 4 — расширение. До 50% трафика, донастройка правил эскалации, сверка качества на выборке.
  • Неделя 5 — 100% трафика. Полное включение, дашборд стоимости и эскалаций.
  • Неделя 6 — финализация. Отчёт «план/факт» по экономии, плейбук на случай деградации, регулярный пересмотр цен.

Сроки ориентировочные: команде из двух инженеров с готовым ботом здесь работы на несколько спринтов, а не кварталов.

09. Ограничения результата

  • Это расчёт, а не измерение. Ни один из показателей не наблюдался в проде; реальный эффект зависит от вашей структуры трафика и качества роутинга.
  • Цены зафиксированы на 12–13 июля 2026 года и меняются: и официальные тарифы, и наценки прокси. Перед решением сверьтесь с актуальными ценами в каталоге.
  • Комиссии не учтены: пополнение баланса, комиссии платёжных систем и НДС могут добавить к итогу; считали только стоимость токенов по тарифам BotHub.
  • Профиль токенов одинаков для всех уровней (6 000 + 1 200). В реальности типовые диалоги обычно короче сложных, так что по лёгкому уровню оценка скорее консервативная, по флагманскому — заниженная.
  • Сплит 70/25/5 — допущение. Стоимость классификации мы исключили из итога (~179 ₽/мес при роутере на DeepSeek V4 Flash), затраты на разработку и качество ответов — за рамками расчёта.

10. Методика расчётов

Формула одна: стоимость диалога = (входные токены × цена входа + выходные токены × цена выхода) / 1 000 000, месяц = сумма по всем диалогам. Пример для Sol: 6 000 × 431,24 / 10⁶ + 1 200 × 2 587,43 / 10⁶ = 2,59 + 3,10 = 5,69 ₽. «Было» = 50 000 × 5,692356 = 284 617,80 ₽. «Стало» = 35 000 × 1,138488 + 12 500 × 2,846184 + 2 500 × 5,692356 = 39 847,08 + 35 577,30 + 14 230,89 = 89 655,27 ₽. Все промежуточные значения считались без округления; округляли только при выводе. Цены — минимальные среди прокси-сервисов нашего каталога (методика сбора — на отдельной странице).

11. Воспроизводимость

Подставьте свои цифры — число диалогов, профиль токенов, доли классов — в калькулятор стоимости: он считает по актуальным ценам каталога, а не по снимку из этого кейса. Если ваш сплит трафика другой, экономика изменится, но формула та же.

12. Связанные модели и сервисы

Модели кейса: GPT-5.6 Sol · GPT-5.6 Terra · GPT-5.6 Luna · Claude Haiku 4.5 · DeepSeek V4 Flash. Цены в расчёте — BotHub; альтернативные прокси и их наценки — в каталоге сервисов. Как выбрать прокси под себя — в гайде «Как выбрать API-прокси».

13. Итоги и выводы

Итог расчёта: при 50 000 диалогов в месяц перевод трафика со схемы «всё на GPT-5.6 Sol» на маршрутизацию 70/25/5 (Luna / Terra / Sol, цены BotHub) снижает затраты на токены с 284 617,80 ₽ до 89 655,27 ₽ в месяц — экономия 194 962,53 ₽ (−68,5%), около 2,34 млн ₽ в год. Средний диалог дешевеет с 5,69 ₽ до 1,79 ₽. Это модельный расчёт по ценам на 12–13.07.2026: прежде чем закладывать эти цифры в бюджет, проверьте сплит и качество на своём трафике.

Главный вывод не в конкретных процентах, а в асимметрии: маршрутизация — недели работы и копеечный роутер, а разница в цене между лёгкой моделью и флагманом — пятикратная. Даже если у вас типовых запросов вдвое меньше, чем в нашем допущении, счёт за токены всё равно сожмётся заметно. Начните с разметки сотни своих диалогов — дальше арифметика сделает всё сама.