Обновлено: 7 сентября 2026

Это модельный кейс, а не отчёт клиента. У нас нет заказчика с такими данными: сценарий условный, а все цены — реальные, из нашего каталога на 12–13 июля 2026 года. Мы не называем компаний, не приводим «результатов внедрения» и не обещаем, что качество ответов не изменится, — это расчёт экономики маршрутизации, который вы можете повторить на своих цифрах.

Идея кейса простая: типовой чат-бот поддержки отвечает флагманской моделью на все запросы подряд, хотя большинство обращений — «где мой заказ» и «как сменить тариф». Мы посчитали, что произойдёт со счётом за токены, если развести трафик по трём уровням моделей. При заданных допущениях затраты снижаются с 284 618 ₽ до 89 655 ₽ в месяц — то есть на 68,5%.

01. Исходная задача

Условный SaaS-сервис держит чат-бот первой линии поддержки:

  • 50 000 диалогов в месяц;
  • средний диалог: 6 000 входных токенов (системный промпт, история, фрагменты базы знаний) и 1 200 выходных;
  • итого в месяц: 300 млн входных и 60 млн выходных токенов;
  • все запросы обслуживает флагман GPT-5.6 Sol.

Оплата официальных API из России ограничена, поэтому считаем по ценам прокси-сервисов. Минимальные цены на все нужные модели в наших данных — у BotHub: наценка к официальному тарифу +12,5%. Для сравнения: напрямую у OpenAI тот же трафик на Sol стоил бы 252 992,40 ₽ в месяц, через BotHub — 284 617,80 ₽.

Задача: снизить расходы, не трогая сам продукт — меняем только то, какая модель отвечает на какой запрос.

Две оговорки к снимку цен. 22 августа 2026 года OpenAI временно снизила цену Sol и обещает держать её как минимум до 21 ноября 2026 года, так что разрыв между уровнями сегодня меньше, чем в расчёте. А с 3 сентября над Sol стоит GPT-6 Astra: если бот отвечает ею, маршрутизация выгодна ещё сильнее.

02. Что было и что стало

Было — монолит. Пользователь → один системный промпт → GPT-5.6 Sol для 100% запросов → ответ. Флагман работает и над разбором инцидента, и над вопросом «как выйти из аккаунта».

Стало — маршрутизация на три уровня. Пользователь → классификатор запроса (правила + лёгкая модель) → одна из трёх веток:

  • типовые запросы → лёгкая модель GPT-5.6 Luna;
  • средние → рабочая модель GPT-5.6 Terra;
  • сложные → флагман GPT-5.6 Sol.

Отдельно нужна страховка: если лёгкая модель не справилась (низкая уверенность, повторный вопрос пользователя, явное «позови человека»), диалог эскалируется на уровень выше.

Схема маршрутизации: классификатор делит 50 000 диалогов на три уровня моделей — 70, 25 и 5 процентов
Распределение трафика и цена диалога на каждом уровне (цены BotHub на 12–13 июля 2026)

03. Что изменили

  • Классификация запросов. Каждое обращение получает класс сложности до того, как уйдёт в основную модель. Подойдут эвристики (длина, ключевые слова, раздел продукта) или дешёвая языковая модель: классификатор на DeepSeek V4 Flash при 500 входных и 20 выходных токенах на запрос обходился примерно в 179 ₽ в месяц на весь поток (по ценам июля 2026 года, как и весь расчёт ниже) — в расчёте ниже этой суммой пренебрегаем.
  • Три уровня моделей вместо одного. Один и тот же промпт-шаблон, разные модели: Luna, Terra, Sol.
  • Правила эскалации. Ошибка классификатора не должна стоить компании клиента: сомнительные случаи всегда уходят на уровень выше.

04. Как расходится трафик

Доли классов — допущение кейса, основанное на типовой структуре обращений первой линии; вашу реальную структуру покажет только разметка собственных диалогов.

Класс запроса Примеры Модель Доля Цена диалога*
Типовые FAQ, статусы заказов, навигация по продукту GPT-5.6 Luna 70% 1,14 ₽
Средние Настройки, биллинг, ошибки по инструкции GPT-5.6 Terra 25% 2,85 ₽
Сложные Инциденты, разбор логов, нестандартные случаи GPT-5.6 Sol 5% 5,69 ₽
Средневзвешенно 100% 1,79 ₽

* При профиле 6 000 входных + 1 200 выходных токенов, по ценам BotHub. Для сравнения: диалог целиком на Sol стоит 5,69 ₽.

05. Динамика стоимости

Цены, по которым считаем (BotHub, минимальные в нашем каталоге на 12–13.07.2026, ₽ за 1 млн токенов, вход / выход): Sol — 431,24 / 2 587,43; Terra — 215,62 / 1 293,72; Luna — 86,25 / 517,49.

Уровень Диалогов Токены вход/выход, млн Стоимость, ₽/мес Доля затрат
Лёгкий (Luna) 35 000 210 / 42 39 847,08 44,4%
Средний (Terra) 12 500 75 / 15 35 577,30 39,7%
Флагман (Sol) 2 500 15 / 3 14 230,89 15,9%
Итого «стало» 50 000 300 / 60 89 655,27 100%
Было: всё на Sol 50 000 300 / 60 284 617,80
Экономия 194 962,53 в месяц (−68,5%)

Средняя стоимость диалога падает с 5,69 ₽ до 1,79 ₽. В годовом выражении экономия — около 2,34 млн ₽. Обратите внимание на структуру «стало»: 5% сложных диалогов съедают 15,9% бюджета — флагман дорог даже в малых количествах.

Вариант с Claude Haiku 4.5 на лёгком уровне (у неё дешевле выход: 86,25 / 431,24 ₽ за 1 млн через BotHub): диалог — 1,03 ₽, месяц целиком — 86 032,77 ₽, экономия 198 585,03 ₽ (−69,8%). Разница с Luna невелика; выбирать стоит по качеству ответов на вашем трафике, а не по этим копейкам.

06. Качество ответов: риски и контроль

Здесь важнее всего не приукрасить: у нас нет данных о качестве, и в расчётном кейсе их быть не может. Утверждать «качество не упало» мы не будем — это проверяется только на вашем трафике. Что известно из практики маршрутизации и что с этим делать:

  • Лёгкая модель хуже держит сложные случаи. Контроль: правила эскалации плюс классификатор, настроенный «сомневаешься — отправляй выше». Каждый лишний процент трафика на Terra вместо Luna стоит около 854 ₽ в месяц (500 диалогов × 1,71 ₽ разницы) — страховка дешёвая, закладывайте её смело.
  • Ошибки маршрутизации. Контроль: ручная разметка выборки диалогов до запуска и регулярная проверка после; A/B-тест маршрутизации на 10% трафика перед полным включением.
  • Незаметная деградация со временем. Контроль: метрики доли эскалаций, повторных обращений и оценок пользователей — на панель наблюдения с первого дня.

Если после проверки окажется, что лёгкий уровень тянет только 50% трафика, а не 70%, — пересчитайте: экономия уменьшится, но не исчезнет.

07. Стек и модели

  • Доступ к моделям — BotHub: OpenAI-совместимый API, все четыре модели кейса в одном аккаунте, оплата российскими картами. Подойдёт и другой прокси-сервис — пересчитайте на его цены.
  • Классификатор — эвристики или дешёвая модель (DeepSeek V4 Flash, около 179 ₽/мес на весь поток по ценам июля 2026 года), либо обычный ML-классификатор на своей стороне.
  • Наблюдаемость: логирование класса запроса, модели, токенов и стоимости на каждый диалог — без этого экономику не проверить.

08. План внедрения на шесть недель

  • Недели 1–2 — аудит. Выгрузка и разметка выборки диалогов, реальная структура классов, базовые метрики стоимости.
  • Неделя 3 — первая версия классификатора. Правила и модель, прогон на исторических данных, A/B на 10% трафика.
  • Неделя 4 — расширение. До 50% трафика, донастройка правил эскалации, сверка качества на выборке.
  • Неделя 5 — 100% трафика. Полное включение, панель со стоимостью и долей эскалаций.
  • Неделя 6 — финализация. Отчёт «план/факт» по экономии, инструкция на случай деградации, регулярный пересмотр цен.

Сроки ориентировочные: команде из двух инженеров с готовым ботом здесь работы на несколько недель, а не кварталов.

09. Ограничения результата

  • Это расчёт, а не измерение. Ни один из показателей не наблюдался на реальном трафике; эффект зависит от вашей структуры обращений и качества классификатора.
  • Цены зафиксированы на 12–13 июля 2026 года и меняются: и официальные тарифы, и наценки прокси. Официальную цену Sol OpenAI с тех пор временно снизила (см. раздел 01), а цену BotHub сервис считает от общего поля каталога OpenRouter, и она плавает без решения самого сервиса (подробнее — в карточке BotHub). Перед решением сверьтесь с актуальными ценами в каталоге.
  • Комиссии не учтены: пополнение баланса, комиссии платёжных систем и НДС могут добавить к итогу; считали только стоимость токенов по тарифам BotHub.
  • Профиль токенов одинаков для всех уровней (6 000 + 1 200). В реальности типовые диалоги короче сложных, так что по лёгкому уровню оценка скорее консервативная.
  • Разделение 70/25/5 — допущение. Стоимость классификации исключена из итога, затраты на разработку и качество ответов — за рамками расчёта.

10. Методика расчётов

Формула одна: стоимость диалога = (входные токены × цена входа + выходные токены × цена выхода) / 1 000 000, месяц = сумма по всем диалогам. Пример для Sol: 6 000 × 431,24 / 10⁶ + 1 200 × 2 587,43 / 10⁶ = 2,59 + 3,10 = 5,69 ₽. «Было» = 50 000 × 5,692356 = 284 617,80 ₽. «Стало» = 35 000 × 1,138488 + 12 500 × 2,846184 + 2 500 × 5,692356 = 39 847,08 + 35 577,30 + 14 230,89 = 89 655,27 ₽. Все промежуточные значения считались без округления; округляли только при выводе. Цены — минимальные среди прокси-сервисов нашего каталога (методика сбора — на отдельной странице).

11. Повторите расчёт на своих цифрах

Подставьте свои данные — число диалогов, профиль токенов, доли классов — в калькулятор стоимости: он считает по актуальным ценам каталога, а не по снимку из этого кейса. Если ваше распределение трафика другое, экономика изменится, но формула останется той же.

Цены в расчёте — BotHub; альтернативные прокси и их наценки — в каталоге сервисов. Как выбрать прокси под себя — в гайде «Как выбрать API-прокси».

12. С чего начать у себя

Главное в этом расчёте не конкретные проценты, а асимметрия: маршрутизация — это недели работы и копеечный классификатор, а разница в цене между лёгкой моделью и флагманом пятикратная. Даже если типовых запросов у вас вдвое меньше, чем в нашем допущении, счёт за токены всё равно заметно сожмётся.

Первый шаг стоит меньше всего: разметьте сотню своих диалогов по трём классам и посчитайте долю каждого. Если типовых наберётся хотя бы половина, дальше считать экономику имеет смысл; если нет — маршрутизация вам не нужна, и вы узнали это за один вечер.

Вопросы и ответы о маршрутизации

Не станет ли бот заметно хуже отвечать?

Проверяется только на вашем трафике — у нас таких данных нет и в расчётном кейсе быть не может. Практическая страховка описана в разделе 06: правила эскалации, классификатор с настройкой «сомневаешься — отправляй выше» и метрики повторных обращений с первого дня. Каждый лишний процент трафика, отданный уровню выше, стоит около 854 ₽ в месяц — это дешевле одного потерянного клиента.

Сколько стоит сам классификатор?

При маршрутизации дешёвой моделью — около 179 ₽ в месяц на весь поток из 50 000 диалогов (500 входных и 20 выходных токенов на запрос, DeepSeek V4 Flash по ценам BotHub). На фоне экономии в 194 962 ₽ этой суммой можно пренебречь, что мы и сделали. На эвристиках она равна нулю, но и точность будет ниже.

Экономия зависит от того, что доли ровно 70/25/5?

Нет, зависит только от того, какая часть трафика уходит на дешёвый уровень. При распределении 50/35/15 экономия уменьшится примерно до половины исходной, но останется. Точку, в которой маршрутизация перестаёт окупаться, легко нащупать в калькуляторе — подставьте своё распределение.

Почему считали по ценам прокси, а не по официальным?

Оплата официальных API из России ограничена, поэтому практический счёт получается именно через посредника. Для сравнения мы привели и официальную цифру: тот же трафик на Sol у OpenAI стоил бы 252 992,40 ₽ против 284 617,80 ₽ через BotHub — наценка +12,5%.

Подойдёт ли схема не для поддержки?

Схема работает везде, где обращения делятся по сложности, а объём большой: модерация, обработка заявок, разбор писем, черновики ответов. Условие одно — типовых запросов должно быть заметно больше сложных. Если поток однородный, экономить нечего: маршрутизация только добавит звено.