Обновлено: 20 июля 2026
Большинству задач хватает моделей среднего класса вроде GPT-5.4 или Claude Sonnet 4.6; флагманы нужны там, где цена ошибки выше цены токенов, а массовые операции выгоднее гонять на бюджетных моделях вроде DeepSeek V4 Flash. Рабочее правило простое: начинайте с дешёвой модели и поднимайтесь классом выше только там, где качества не хватает. Ниже — все 26 текстовых моделей нашего каталога, разложенные по четырём классам, и таблица «задача → модель».
Четыре класса вместо двух десятков имён
Держать в голове два десятка названий не нужно — достаточно четырёх классов: флагманы, рабочие лошадки, бюджетные и российские модели. Сразу честная оговорка: это редакционная группировка по цене и позиционированию вендоров, а не рейтинг качества — способности моделей мы не измеряем, их проверяет только тест на ваших данных. Цены цифрами в статьях не пишем — они живут в таблицах моделей и обновляются автоматически; здесь сравниваем классы, контекст и модальности.
Флагманы: когда цена ошибки выше цены токенов
Верх каталога — восемь моделей: GPT-5.6 Sol, GPT-5.5, Claude Fable 5, Claude Opus 4.8, Gemini 3.1 Pro, Grok 4.5, Kimi K3 и Qwen 3.8 Max. Sol — флагман линейки GPT-5.6, вышедшей в июле 2026-го, Fable 5 — новый верхний тир Anthropic, стоящий выше Opus, K3 от Moonshot AI и Qwen 3.8 Max от Alibaba — китайские флагманы июля 2026-го, причём Qwen пока в статусе превью: без открытых весов, официального прайса и подтверждённого контекста. Контексты у остальных — самые большие на рынке: около миллиона токенов у всех, кроме Grok 4.5 с его 500 000. На вход эти модели принимают не только текст: у моделей OpenAI, Anthropic и Grok — изображения с файлами, у Kimi K3 — изображения, у Qwen 3.8 Max заявлены изображения, видео и документы (пока это заявление вендора, в данных OpenRouter модели нет), а Gemini 3.1 Pro понимает ещё аудио и видео.
Флагман оправдан, когда задача сложная и дорогая сама по себе: многошаговые агентные цепочки, архитектурные решения в коде, разбор, где переделка стоит дороже токенов. Второй веский повод — работа с огромными документами: миллионный контекст вмещает книгу или заметную часть репозитория.
Для потоковых однотипных запросов флагман — перерасход: разницу с классом ниже вы заметите на сложных кейсах, а платить будете за каждый запрос.
Рабочие лошадки: выбор по умолчанию
Средний класс — пять моделей: GPT-5.6 Terra, GPT-5.4, Claude Sonnet 5, Claude Sonnet 4.6 и Gemini Flash. Terra — средний тир свежей линейки GPT-5.6, Sonnet 5 — новое поколение Sonnet. По контексту класс не уступает флагманам — миллион токенов и больше, — а мультимодальность на месте: изображения и файлы у всех пяти, аудио и видео — у Gemini Flash.
Это разумная точка старта для продуктовых задач: чат-боты, генерация и ревью кода, работа с документами, тексты для людей. Начните сравнение отсюда — а потом проверьте, не справится ли класс ниже.
Бюджетные: массовые операции
Самый населённый класс — одиннадцать моделей: GPT-5.6 Luna, GPT-5.4 mini, Claude Haiku 4.5, DeepSeek V4 Flash и DeepSeek V4 Pro, предыдущая DeepSeek V3.2, GLM-5 и GLM-5.2, Qwen и Qwen 3.7 Max, Kimi K2. Открытые линейки здесь живут парами поколений — сервисы продают старую и новую ревизии параллельно, поэтому наценку сравнивайте на одинаковой версии.
Контексты разбежались: у свежих моделей — GPT-5.6 Luna, DeepSeek V4, GLM-5.2, Qwen 3.7 Max — окно около миллиона токенов, как у флагманов; у DeepSeek V3.2 и Kimi K2 — 131 072, у GPT-5.4 mini — 400 000. По модальностям видна граница: у GPT-5.6 Luna, GPT-5.4 mini и Claude Haiku 4.5 вход мультимодальный, а у бюджетных ревизий открытых линеек DeepSeek, GLM, Qwen и Kimi мультимодальный вход в данных OpenRouter не заявлен — считайте их текстовыми (изображения понимают флагманские Kimi K3 и Qwen 3.8 Max классом выше).
Класс создан для массовых операций: классификация, извлечение полей из документов, модерация, суммаризация потока текстов, черновики. Там, где запросов тысячи в день, а каждый по отдельности прост, бюджетной модели часто достаточно — но проверьте это на своём наборе примеров, а не на ощущениях.
Российские: рубли и данные в РФ
Отдельный класс — и отдельная ось сравнения: GigaChat Max от Сбера и YandexGPT от Яндекса выбирают не по цене за токен, а по требованиям. Локализация данных в России (Сбер прямо заявляет хранение на серверах в РФ), договор с российским юрлицом напрямую у вендора, оплата в рублях без посредников — если хотя бы одно из этого обязательно, начинайте отсюда.
У Сбера физлицам заявлен бесплатный стартовый объём токенов на 12 месяцев — основная его часть приходится на младшую модель линейки. YandexGPT продаётся через платформу Yandex AI Studio с открытым прайсом. Подробный разбор обеих платформ — в гайде YandexGPT и GigaChat; способности, как и везде, проверяйте на своей задаче.
Критерии: контекст, модальности, цена класса
Контекст — сколько токенов модель держит в одном запросе. В каталоге разброс от 131 072 у DeepSeek V3.2 и Kimi K2 до миллиона с лишним у свежих линеек. Если вы не загружаете в модель книги и репозитории, гнаться за миллионом незачем — но для RAG-систем и разбора больших документов контекст становится главным критерием.
Модальности — что модель принимает на вход. По данным OpenRouter на дату обновления, аудио и видео среди текстовых моделей каталога понимают только Gemini 3.1 Pro и Gemini Flash; изображения и файлы — модели OpenAI, Anthropic и Grok 4.5, изображения — Kimi K3; для Qwen 3.8 Max изображения, видео и документы заявлены самим вендором. У остальных открытых и китайских линеек мультимодальный вход не заявлен.
Цена класса. Соседние классы отличаются в разы, крайние модели каталога — на порядки; точное соотношение зависит от того, что вы сравниваете — вход, выход или их сумму под ваш профиль запросов. Конкретные цифры и наценки сервисов смотрите в таблицах моделей: там дата обновления стоит у каждой цены, а расчёт описан в методике.
Таблица: задача → класс → модель
Соответствия ниже — редакционный ориентир для старта, а не результат бенчмарка: проверяйте кандидатов на своих примерах.
| Задача | Класс для старта | Пример модели |
|---|---|---|
| Агентные цепочки, сложные рассуждения | флагман | Claude Fable 5 |
| Работа с максимальным контекстом | флагман | GPT-5.6 Sol |
| Разбор видео и аудио | линейка Google | Gemini 3.1 Pro |
| Чат-бот, генерация текстов | рабочая лошадка | GPT-5.6 Terra |
| Генерация и ревью кода | рабочая лошадка | Claude Sonnet 5 |
| Классификация, извлечение данных | бюджетный | DeepSeek V4 Flash |
| Суммаризация потока документов | бюджетный | Claude Haiku 4.5 |
| Черновики и простые запросы в объёме | бюджетный | GPT-5.6 Luna |
| Данные строго в РФ, договор с вендором | российский | GigaChat Max |
Начинайте с дешёвой и поднимайтесь
Практичная стратегия выбора — снизу вверх. Соберите десяток типовых примеров своей задачи, прогоните через бюджетную модель и посмотрите на провалы: важны не разовые огрехи, а систематические ошибки одного типа. Есть такие — поднимитесь до рабочей лошадки; не хватает и её — вот теперь флагман оправдан, и вы точно знаете почему.
Такой путь удобно проходить через сервисы с одним ключом на много моделей: AITunnel заявляет 200+ моделей, VseGPT — 120+. Смена модели в OpenAI-совместимом API — обычно правка одного идентификатора; сверьте только, что сервис поддерживает нужные вам параметры для новой модели.
Вопросы и ответы
Чем флагман отличается от рабочей лошадки на практике?
На простых запросах — часто ничем, разница проявляется на сложных: длинные цепочки рассуждений, запутанный код, тонкие формулировки. Именно поэтому сравнивать классы нужно на своих трудных примерах, а не на «привет, как дела».
Правда ли бюджетные модели сильно хуже?
На массовых простых задачах — классификация, извлечение, суммаризация — разница часто незаметна, а стоят они на порядки дешевле флагманов. Проверяется это только на ваших данных: соберите тестовый набор и сравните ответы двух классов.
Какие модели каталога понимают видео и аудио?
По данным OpenRouter — только линейка Google: Gemini 3.1 Pro и Gemini Flash. Видео на входе заявляет также Qwen 3.8 Max — пока словами вендора, без подтверждения в данных OpenRouter. Изображения и файлы принимают модели OpenAI, Anthropic и Grok 4.5, изображения — Kimi K3; у линеек DeepSeek, GLM, Kimi K2 и младших Qwen мультимодальный вход не заявлен.
Когда выбирать российские модели вместо мировых линеек?
Когда решают требования, а не бенчмарки: хранение данных в РФ, прямой договор с российским вендором, оплата в рублях без посредников. Сбер прямо заявляет хранение данных GigaChat на серверах в России; сравнение двух платформ — в отдельном гайде.
Где сравнить цены моделей между собой?
В таблицах нашего каталога: у каждой модели — официальный тариф и цены сервисов доступа с датой обновления, начните со страницы все модели. В статьях цифры не публикуем принципиально — они устаревают быстрее текста.