Обновлено: 7 сентября 2026
Это модельный кейс, а не отчёт клиента. У нас нет заказчика с такими данными: сценарий условный, а все цены — реальные, из нашего каталога на 12–13 июля 2026 года. Мы не называем компаний, не приводим «результатов внедрения» и не обещаем, что качество ответов не изменится, — это расчёт экономики маршрутизации, который вы можете повторить на своих цифрах.
Идея кейса простая: типовой чат-бот поддержки отвечает флагманской моделью на все запросы подряд, хотя большинство обращений — «где мой заказ» и «как сменить тариф». Мы посчитали, что произойдёт со счётом за токены, если развести трафик по трём уровням моделей. При заданных допущениях затраты снижаются с 284 618 ₽ до 89 655 ₽ в месяц — то есть на 68,5%.
01. Исходная задача
Условный SaaS-сервис держит чат-бот первой линии поддержки:
- 50 000 диалогов в месяц;
- средний диалог: 6 000 входных токенов (системный промпт, история, фрагменты базы знаний) и 1 200 выходных;
- итого в месяц: 300 млн входных и 60 млн выходных токенов;
- все запросы обслуживает флагман GPT-5.6 Sol.
Оплата официальных API из России ограничена, поэтому считаем по ценам прокси-сервисов. Минимальные цены на все нужные модели в наших данных — у BotHub: наценка к официальному тарифу +12,5%. Для сравнения: напрямую у OpenAI тот же трафик на Sol стоил бы 252 992,40 ₽ в месяц, через BotHub — 284 617,80 ₽.
Задача: снизить расходы, не трогая сам продукт — меняем только то, какая модель отвечает на какой запрос.
Две оговорки к снимку цен. 22 августа 2026 года OpenAI временно снизила цену Sol и обещает держать её как минимум до 21 ноября 2026 года, так что разрыв между уровнями сегодня меньше, чем в расчёте. А с 3 сентября над Sol стоит GPT-6 Astra: если бот отвечает ею, маршрутизация выгодна ещё сильнее.
02. Что было и что стало
Было — монолит. Пользователь → один системный промпт → GPT-5.6 Sol для 100% запросов → ответ. Флагман работает и над разбором инцидента, и над вопросом «как выйти из аккаунта».
Стало — маршрутизация на три уровня. Пользователь → классификатор запроса (правила + лёгкая модель) → одна из трёх веток:
- типовые запросы → лёгкая модель GPT-5.6 Luna;
- средние → рабочая модель GPT-5.6 Terra;
- сложные → флагман GPT-5.6 Sol.
Отдельно нужна страховка: если лёгкая модель не справилась (низкая уверенность, повторный вопрос пользователя, явное «позови человека»), диалог эскалируется на уровень выше.
03. Что изменили
- Классификация запросов. Каждое обращение получает класс сложности до того, как уйдёт в основную модель. Подойдут эвристики (длина, ключевые слова, раздел продукта) или дешёвая языковая модель: классификатор на DeepSeek V4 Flash при 500 входных и 20 выходных токенах на запрос обходился примерно в 179 ₽ в месяц на весь поток (по ценам июля 2026 года, как и весь расчёт ниже) — в расчёте ниже этой суммой пренебрегаем.
- Три уровня моделей вместо одного. Один и тот же промпт-шаблон, разные модели: Luna, Terra, Sol.
- Правила эскалации. Ошибка классификатора не должна стоить компании клиента: сомнительные случаи всегда уходят на уровень выше.
04. Как расходится трафик
Доли классов — допущение кейса, основанное на типовой структуре обращений первой линии; вашу реальную структуру покажет только разметка собственных диалогов.
| Класс запроса | Примеры | Модель | Доля | Цена диалога* |
|---|---|---|---|---|
| Типовые | FAQ, статусы заказов, навигация по продукту | GPT-5.6 Luna | 70% | 1,14 ₽ |
| Средние | Настройки, биллинг, ошибки по инструкции | GPT-5.6 Terra | 25% | 2,85 ₽ |
| Сложные | Инциденты, разбор логов, нестандартные случаи | GPT-5.6 Sol | 5% | 5,69 ₽ |
| Средневзвешенно | 100% | 1,79 ₽ |
* При профиле 6 000 входных + 1 200 выходных токенов, по ценам BotHub. Для сравнения: диалог целиком на Sol стоит 5,69 ₽.
05. Динамика стоимости
Цены, по которым считаем (BotHub, минимальные в нашем каталоге на 12–13.07.2026, ₽ за 1 млн токенов, вход / выход): Sol — 431,24 / 2 587,43; Terra — 215,62 / 1 293,72; Luna — 86,25 / 517,49.
| Уровень | Диалогов | Токены вход/выход, млн | Стоимость, ₽/мес | Доля затрат |
|---|---|---|---|---|
| Лёгкий (Luna) | 35 000 | 210 / 42 | 39 847,08 | 44,4% |
| Средний (Terra) | 12 500 | 75 / 15 | 35 577,30 | 39,7% |
| Флагман (Sol) | 2 500 | 15 / 3 | 14 230,89 | 15,9% |
| Итого «стало» | 50 000 | 300 / 60 | 89 655,27 | 100% |
| Было: всё на Sol | 50 000 | 300 / 60 | 284 617,80 | — |
| Экономия | 194 962,53 в месяц (−68,5%) |
Средняя стоимость диалога падает с 5,69 ₽ до 1,79 ₽. В годовом выражении экономия — около 2,34 млн ₽. Обратите внимание на структуру «стало»: 5% сложных диалогов съедают 15,9% бюджета — флагман дорог даже в малых количествах.
Вариант с Claude Haiku 4.5 на лёгком уровне (у неё дешевле выход: 86,25 / 431,24 ₽ за 1 млн через BotHub): диалог — 1,03 ₽, месяц целиком — 86 032,77 ₽, экономия 198 585,03 ₽ (−69,8%). Разница с Luna невелика; выбирать стоит по качеству ответов на вашем трафике, а не по этим копейкам.
06. Качество ответов: риски и контроль
Здесь важнее всего не приукрасить: у нас нет данных о качестве, и в расчётном кейсе их быть не может. Утверждать «качество не упало» мы не будем — это проверяется только на вашем трафике. Что известно из практики маршрутизации и что с этим делать:
- Лёгкая модель хуже держит сложные случаи. Контроль: правила эскалации плюс классификатор, настроенный «сомневаешься — отправляй выше». Каждый лишний процент трафика на Terra вместо Luna стоит около 854 ₽ в месяц (500 диалогов × 1,71 ₽ разницы) — страховка дешёвая, закладывайте её смело.
- Ошибки маршрутизации. Контроль: ручная разметка выборки диалогов до запуска и регулярная проверка после; A/B-тест маршрутизации на 10% трафика перед полным включением.
- Незаметная деградация со временем. Контроль: метрики доли эскалаций, повторных обращений и оценок пользователей — на панель наблюдения с первого дня.
Если после проверки окажется, что лёгкий уровень тянет только 50% трафика, а не 70%, — пересчитайте: экономия уменьшится, но не исчезнет.
07. Стек и модели
- Доступ к моделям — BotHub: OpenAI-совместимый API, все четыре модели кейса в одном аккаунте, оплата российскими картами. Подойдёт и другой прокси-сервис — пересчитайте на его цены.
- Классификатор — эвристики или дешёвая модель (DeepSeek V4 Flash, около 179 ₽/мес на весь поток по ценам июля 2026 года), либо обычный ML-классификатор на своей стороне.
- Наблюдаемость: логирование класса запроса, модели, токенов и стоимости на каждый диалог — без этого экономику не проверить.
08. План внедрения на шесть недель
- Недели 1–2 — аудит. Выгрузка и разметка выборки диалогов, реальная структура классов, базовые метрики стоимости.
- Неделя 3 — первая версия классификатора. Правила и модель, прогон на исторических данных, A/B на 10% трафика.
- Неделя 4 — расширение. До 50% трафика, донастройка правил эскалации, сверка качества на выборке.
- Неделя 5 — 100% трафика. Полное включение, панель со стоимостью и долей эскалаций.
- Неделя 6 — финализация. Отчёт «план/факт» по экономии, инструкция на случай деградации, регулярный пересмотр цен.
Сроки ориентировочные: команде из двух инженеров с готовым ботом здесь работы на несколько недель, а не кварталов.
09. Ограничения результата
- Это расчёт, а не измерение. Ни один из показателей не наблюдался на реальном трафике; эффект зависит от вашей структуры обращений и качества классификатора.
- Цены зафиксированы на 12–13 июля 2026 года и меняются: и официальные тарифы, и наценки прокси. Официальную цену Sol OpenAI с тех пор временно снизила (см. раздел 01), а цену BotHub сервис считает от общего поля каталога OpenRouter, и она плавает без решения самого сервиса (подробнее — в карточке BotHub). Перед решением сверьтесь с актуальными ценами в каталоге.
- Комиссии не учтены: пополнение баланса, комиссии платёжных систем и НДС могут добавить к итогу; считали только стоимость токенов по тарифам BotHub.
- Профиль токенов одинаков для всех уровней (6 000 + 1 200). В реальности типовые диалоги короче сложных, так что по лёгкому уровню оценка скорее консервативная.
- Разделение 70/25/5 — допущение. Стоимость классификации исключена из итога, затраты на разработку и качество ответов — за рамками расчёта.
10. Методика расчётов
Формула одна: стоимость диалога = (входные токены × цена входа + выходные токены × цена выхода) / 1 000 000, месяц = сумма по всем диалогам. Пример для Sol: 6 000 × 431,24 / 10⁶ + 1 200 × 2 587,43 / 10⁶ = 2,59 + 3,10 = 5,69 ₽. «Было» = 50 000 × 5,692356 = 284 617,80 ₽. «Стало» = 35 000 × 1,138488 + 12 500 × 2,846184 + 2 500 × 5,692356 = 39 847,08 + 35 577,30 + 14 230,89 = 89 655,27 ₽. Все промежуточные значения считались без округления; округляли только при выводе. Цены — минимальные среди прокси-сервисов нашего каталога (методика сбора — на отдельной странице).
11. Повторите расчёт на своих цифрах
Подставьте свои данные — число диалогов, профиль токенов, доли классов — в калькулятор стоимости: он считает по актуальным ценам каталога, а не по снимку из этого кейса. Если ваше распределение трафика другое, экономика изменится, но формула останется той же.
Цены в расчёте — BotHub; альтернативные прокси и их наценки — в каталоге сервисов. Как выбрать прокси под себя — в гайде «Как выбрать API-прокси».
12. С чего начать у себя
Главное в этом расчёте не конкретные проценты, а асимметрия: маршрутизация — это недели работы и копеечный классификатор, а разница в цене между лёгкой моделью и флагманом пятикратная. Даже если типовых запросов у вас вдвое меньше, чем в нашем допущении, счёт за токены всё равно заметно сожмётся.
Первый шаг стоит меньше всего: разметьте сотню своих диалогов по трём классам и посчитайте долю каждого. Если типовых наберётся хотя бы половина, дальше считать экономику имеет смысл; если нет — маршрутизация вам не нужна, и вы узнали это за один вечер.
Вопросы и ответы о маршрутизации
Не станет ли бот заметно хуже отвечать?
Проверяется только на вашем трафике — у нас таких данных нет и в расчётном кейсе быть не может. Практическая страховка описана в разделе 06: правила эскалации, классификатор с настройкой «сомневаешься — отправляй выше» и метрики повторных обращений с первого дня. Каждый лишний процент трафика, отданный уровню выше, стоит около 854 ₽ в месяц — это дешевле одного потерянного клиента.
Сколько стоит сам классификатор?
При маршрутизации дешёвой моделью — около 179 ₽ в месяц на весь поток из 50 000 диалогов (500 входных и 20 выходных токенов на запрос, DeepSeek V4 Flash по ценам BotHub). На фоне экономии в 194 962 ₽ этой суммой можно пренебречь, что мы и сделали. На эвристиках она равна нулю, но и точность будет ниже.
Экономия зависит от того, что доли ровно 70/25/5?
Нет, зависит только от того, какая часть трафика уходит на дешёвый уровень. При распределении 50/35/15 экономия уменьшится примерно до половины исходной, но останется. Точку, в которой маршрутизация перестаёт окупаться, легко нащупать в калькуляторе — подставьте своё распределение.
Почему считали по ценам прокси, а не по официальным?
Оплата официальных API из России ограничена, поэтому практический счёт получается именно через посредника. Для сравнения мы привели и официальную цифру: тот же трафик на Sol у OpenAI стоил бы 252 992,40 ₽ против 284 617,80 ₽ через BotHub — наценка +12,5%.
Подойдёт ли схема не для поддержки?
Схема работает везде, где обращения делятся по сложности, а объём большой: модерация, обработка заявок, разбор писем, черновики ответов. Условие одно — типовых запросов должно быть заметно больше сложных. Если поток однородный, экономить нечего: маршрутизация только добавит звено.