Обновлено: 20 июля 2026

Большинству задач хватает моделей среднего класса вроде GPT-5.4 или Claude Sonnet 4.6; флагманы нужны там, где цена ошибки выше цены токенов, а массовые операции выгоднее гонять на бюджетных моделях вроде DeepSeek V4 Flash. Рабочее правило простое: начинайте с дешёвой модели и поднимайтесь классом выше только там, где качества не хватает. Ниже — все 26 текстовых моделей нашего каталога, разложенные по четырём классам, и таблица «задача → модель».

Четыре класса вместо двух десятков имён

Держать в голове два десятка названий не нужно — достаточно четырёх классов: флагманы, рабочие лошадки, бюджетные и российские модели. Сразу честная оговорка: это редакционная группировка по цене и позиционированию вендоров, а не рейтинг качества — способности моделей мы не измеряем, их проверяет только тест на ваших данных. Цены цифрами в статьях не пишем — они живут в таблицах моделей и обновляются автоматически; здесь сравниваем классы, контекст и модальности.

Флагманы: когда цена ошибки выше цены токенов

Верх каталога — восемь моделей: GPT-5.6 Sol, GPT-5.5, Claude Fable 5, Claude Opus 4.8, Gemini 3.1 Pro, Grok 4.5, Kimi K3 и Qwen 3.8 Max. Sol — флагман линейки GPT-5.6, вышедшей в июле 2026-го, Fable 5 — новый верхний тир Anthropic, стоящий выше Opus, K3 от Moonshot AI и Qwen 3.8 Max от Alibaba — китайские флагманы июля 2026-го, причём Qwen пока в статусе превью: без открытых весов, официального прайса и подтверждённого контекста. Контексты у остальных — самые большие на рынке: около миллиона токенов у всех, кроме Grok 4.5 с его 500 000. На вход эти модели принимают не только текст: у моделей OpenAI, Anthropic и Grok — изображения с файлами, у Kimi K3 — изображения, у Qwen 3.8 Max заявлены изображения, видео и документы (пока это заявление вендора, в данных OpenRouter модели нет), а Gemini 3.1 Pro понимает ещё аудио и видео.

Флагман оправдан, когда задача сложная и дорогая сама по себе: многошаговые агентные цепочки, архитектурные решения в коде, разбор, где переделка стоит дороже токенов. Второй веский повод — работа с огромными документами: миллионный контекст вмещает книгу или заметную часть репозитория.

Для потоковых однотипных запросов флагман — перерасход: разницу с классом ниже вы заметите на сложных кейсах, а платить будете за каждый запрос.

Рабочие лошадки: выбор по умолчанию

Средний класс — пять моделей: GPT-5.6 Terra, GPT-5.4, Claude Sonnet 5, Claude Sonnet 4.6 и Gemini Flash. Terra — средний тир свежей линейки GPT-5.6, Sonnet 5 — новое поколение Sonnet. По контексту класс не уступает флагманам — миллион токенов и больше, — а мультимодальность на месте: изображения и файлы у всех пяти, аудио и видео — у Gemini Flash.

Это разумная точка старта для продуктовых задач: чат-боты, генерация и ревью кода, работа с документами, тексты для людей. Начните сравнение отсюда — а потом проверьте, не справится ли класс ниже.

Бюджетные: массовые операции

Самый населённый класс — одиннадцать моделей: GPT-5.6 Luna, GPT-5.4 mini, Claude Haiku 4.5, DeepSeek V4 Flash и DeepSeek V4 Pro, предыдущая DeepSeek V3.2, GLM-5 и GLM-5.2, Qwen и Qwen 3.7 Max, Kimi K2. Открытые линейки здесь живут парами поколений — сервисы продают старую и новую ревизии параллельно, поэтому наценку сравнивайте на одинаковой версии.

Контексты разбежались: у свежих моделей — GPT-5.6 Luna, DeepSeek V4, GLM-5.2, Qwen 3.7 Max — окно около миллиона токенов, как у флагманов; у DeepSeek V3.2 и Kimi K2 — 131 072, у GPT-5.4 mini — 400 000. По модальностям видна граница: у GPT-5.6 Luna, GPT-5.4 mini и Claude Haiku 4.5 вход мультимодальный, а у бюджетных ревизий открытых линеек DeepSeek, GLM, Qwen и Kimi мультимодальный вход в данных OpenRouter не заявлен — считайте их текстовыми (изображения понимают флагманские Kimi K3 и Qwen 3.8 Max классом выше).

Класс создан для массовых операций: классификация, извлечение полей из документов, модерация, суммаризация потока текстов, черновики. Там, где запросов тысячи в день, а каждый по отдельности прост, бюджетной модели часто достаточно — но проверьте это на своём наборе примеров, а не на ощущениях.

Российские: рубли и данные в РФ

Отдельный класс — и отдельная ось сравнения: GigaChat Max от Сбера и YandexGPT от Яндекса выбирают не по цене за токен, а по требованиям. Локализация данных в России (Сбер прямо заявляет хранение на серверах в РФ), договор с российским юрлицом напрямую у вендора, оплата в рублях без посредников — если хотя бы одно из этого обязательно, начинайте отсюда.

У Сбера физлицам заявлен бесплатный стартовый объём токенов на 12 месяцев — основная его часть приходится на младшую модель линейки. YandexGPT продаётся через платформу Yandex AI Studio с открытым прайсом. Подробный разбор обеих платформ — в гайде YandexGPT и GigaChat; способности, как и везде, проверяйте на своей задаче.

Критерии: контекст, модальности, цена класса

Контекст — сколько токенов модель держит в одном запросе. В каталоге разброс от 131 072 у DeepSeek V3.2 и Kimi K2 до миллиона с лишним у свежих линеек. Если вы не загружаете в модель книги и репозитории, гнаться за миллионом незачем — но для RAG-систем и разбора больших документов контекст становится главным критерием.

Модальности — что модель принимает на вход. По данным OpenRouter на дату обновления, аудио и видео среди текстовых моделей каталога понимают только Gemini 3.1 Pro и Gemini Flash; изображения и файлы — модели OpenAI, Anthropic и Grok 4.5, изображения — Kimi K3; для Qwen 3.8 Max изображения, видео и документы заявлены самим вендором. У остальных открытых и китайских линеек мультимодальный вход не заявлен.

Цена класса. Соседние классы отличаются в разы, крайние модели каталога — на порядки; точное соотношение зависит от того, что вы сравниваете — вход, выход или их сумму под ваш профиль запросов. Конкретные цифры и наценки сервисов смотрите в таблицах моделей: там дата обновления стоит у каждой цены, а расчёт описан в методике.

Таблица: задача → класс → модель

Соответствия ниже — редакционный ориентир для старта, а не результат бенчмарка: проверяйте кандидатов на своих примерах.

Задача Класс для старта Пример модели
Агентные цепочки, сложные рассуждения флагман Claude Fable 5
Работа с максимальным контекстом флагман GPT-5.6 Sol
Разбор видео и аудио линейка Google Gemini 3.1 Pro
Чат-бот, генерация текстов рабочая лошадка GPT-5.6 Terra
Генерация и ревью кода рабочая лошадка Claude Sonnet 5
Классификация, извлечение данных бюджетный DeepSeek V4 Flash
Суммаризация потока документов бюджетный Claude Haiku 4.5
Черновики и простые запросы в объёме бюджетный GPT-5.6 Luna
Данные строго в РФ, договор с вендором российский GigaChat Max

Начинайте с дешёвой и поднимайтесь

Практичная стратегия выбора — снизу вверх. Соберите десяток типовых примеров своей задачи, прогоните через бюджетную модель и посмотрите на провалы: важны не разовые огрехи, а систематические ошибки одного типа. Есть такие — поднимитесь до рабочей лошадки; не хватает и её — вот теперь флагман оправдан, и вы точно знаете почему.

Такой путь удобно проходить через сервисы с одним ключом на много моделей: AITunnel заявляет 200+ моделей, VseGPT — 120+. Смена модели в OpenAI-совместимом API — обычно правка одного идентификатора; сверьте только, что сервис поддерживает нужные вам параметры для новой модели.

Вопросы и ответы

Чем флагман отличается от рабочей лошадки на практике?

На простых запросах — часто ничем, разница проявляется на сложных: длинные цепочки рассуждений, запутанный код, тонкие формулировки. Именно поэтому сравнивать классы нужно на своих трудных примерах, а не на «привет, как дела».

Правда ли бюджетные модели сильно хуже?

На массовых простых задачах — классификация, извлечение, суммаризация — разница часто незаметна, а стоят они на порядки дешевле флагманов. Проверяется это только на ваших данных: соберите тестовый набор и сравните ответы двух классов.

Какие модели каталога понимают видео и аудио?

По данным OpenRouter — только линейка Google: Gemini 3.1 Pro и Gemini Flash. Видео на входе заявляет также Qwen 3.8 Max — пока словами вендора, без подтверждения в данных OpenRouter. Изображения и файлы принимают модели OpenAI, Anthropic и Grok 4.5, изображения — Kimi K3; у линеек DeepSeek, GLM, Kimi K2 и младших Qwen мультимодальный вход не заявлен.

Когда выбирать российские модели вместо мировых линеек?

Когда решают требования, а не бенчмарки: хранение данных в РФ, прямой договор с российским вендором, оплата в рублях без посредников. Сбер прямо заявляет хранение данных GigaChat на серверах в России; сравнение двух платформ — в отдельном гайде.

Где сравнить цены моделей между собой?

В таблицах нашего каталога: у каждой модели — официальный тариф и цены сервисов доступа с датой обновления, начните со страницы все модели. В статьях цифры не публикуем принципиально — они устаревают быстрее текста.