Шпаргалка: какую AI-модель под какую задачу (июль 2026)

Обновлено 15 июля 2026 г.

После выхода GPT-5.6 (Sol / Terra / Luna) вопрос «какой моделью работать» перестал иметь один ответ. Правильный подход — не искать «лучшую» модель, а раскидать роли: под каждый тип задачи своя, дешевле там, где можно, надёжнее там, где нужно. Вот рабочая шпаргалка на июль 2026 — по официальным прайсам и независимым замерам.

Таблица ролей

ЗадачаМодельЦена (вход/выход)Почему
Агентский кодинг, считаем деньгиGPT-5.6 Sol$5 / $30Первое место на Coding Agent Index (80) и в 2.6 раза дешевле за задачу, чем Fable
Тот же кодинг, но дешевлеSonnet 5$2 / $10 до 31.08Сейчас дешевле Terra ($2.5/$15) по обеим осям — вводная цена Anthropic
Реализация планаOpus 4.8$5 / $25Вдвое дешевле Fable при том же токенизаторе; и дешевле Sol на выходе
Длинный контекст (больше 272K)Opus 4.8 · Fable 5$5/$25 · $10/$50У всей семьи GPT-5.6 выше 272K наценка ×2/×1.5 на весь запрос; у Anthropic наценки нет
Автономный прогон, где важна корректностьFable 5$10 / $50Первое место на Terminal-Bench 2.1 (83.8 %) — но Sol туда не подавали
Тесты, сбор информации, простые агентыLuna · Haiku 4.5$1/$6 · $1/$5Вход одинаковый, на выходе Haiku дешевле. Независимого сравнения пары нет — меряйте сами
Широкие права, необратимые действияFable 5 · Opus 4.8OpenAI в System Card сама признаёт рост выхода за рамки намерения у GPT-5.6

Цены — с официальных прайсов OpenAI и Anthropic, за 1 млн токенов. Замеры — Artificial Analysis и Terminal-Bench 2.1.

Две ловушки, из-за которых таблица врёт

Цена за токен ≠ счёт в конце месяца. Токенайзеры у вендоров разные, один и тот же текст даёт разное число токенов. Сравнивать по прайсу можно модели одного вендора; между вендорами — только замером на своей нагрузке.

Выше 272 тысяч входных токенов вся семья GPT-5.6 дорожает — ×2 на вход, ×1.5 на выход, причём со всего запроса, а не с превышения. Sol становится $10/$45 против $10/$50 у Fable 5: вся ценовая разница испаряется. У Anthropic весь миллион идёт по стандартной цене.

Кто с кем на самом деле

Независимый Intelligence Index: Fable 5 — 60, Sol — 59, Opus 4.8 — 56, Terra — 55, Luna — 51. Sol метит не в Opus, а в Fable, и не дотягивает один пункт из шестидесяти.

А на Coding Agent Index порядок разворачивается: Sol — 80, Terra и Fable 5 — по 77. При этом задача у Sol стоит $1.04 против $2.75 у Fable. Независимый hands-on Composio подтвердил другой методикой: одинаковые 69 % pass rate при $3.47 против $9.18.

Подробный разбор — в статье «GPT-5.6 против Claude: кто с кем на самом деле конкурирует».

Как это делаем мы

План собираем на модели поумнее, а реализацию отдаём подешевле — Opus 4.8 вдвое дешевле Fable при том же токенизаторе. Тесты, сбор информации и простых агентов гоняем на Luna и Haiku.

Важное про оркестрацию: и Ultra у OpenAI, и Ultracode у Claude Code — это надстройки харнесса, а не свойства моделей. В доках Anthropic сказано прямо: Ultracode — «настройка Claude Code, а не уровень усилия модели», и работает он на любой модели с поддержкой xhigh, не только на Fable. Значит оркестрацию можно собрать самому — и выбирать модель под роль, а не покупать чужую надстройку целиком.

Про подписки: публичных данных нет

Агентские задачи обычно гоняют через API, а разработку большинство ведёт на подписке — и это делает вопрос «сколько влезает в подписку» практичнее любого бенчмарка. Мы искали в два захода: сколько Opus, Fable и Sol помещается в неделю, как считаются недельные окна, с какого объёма API выгоднее подписки. Публичных данных нет — ни цифр по тарифам, ни живых замеров практиков. Не нашли — не пишем.

Один факт есть, и он важный: 12 июля OpenAI временно сняла пятичасовое окно для ChatGPT Work и Codex на планах Plus, Business и Pro — через три дня после запуска GPT-5.6. Недельные потолки при этом остались: спринт стал длиннее, а неделя нет. Дата возврата не объявлена.

Если сидите на подписке — цены выше не про вас. Там задача другая: балансировать недельный лимит между моделями, а не выжигать одну.

Три правила поверх таблицы

1. Права ↔ надёжность. В System Card OpenAI сама признаёт: GPT-5.6 чаще предыдущей версии выходит за рамки намерения пользователя. Чем шире права у агента (удаление, деплой, доступ к секретам) — тем нужнее sandbox и approval-гейты. Разбор — «GPT-5.6: в чём подвох бенчмарков».

2. У осторожности Fable есть счёт. Классификаторы Fable отказывают на кибербезопасности и биологии — в доках Anthropic прямо сказано, что для этих доменов модель не предназначена. Оба независимых оценщика заранее заложили Opus как запасную модель на отказы. Берёте Fable — закладывайте тоже.

3. Держи роутер, не лочься на вендора. Фронтир двигается каждые недели, и мы это видим на своём стеке. Стек, который умеет переключать модель без переписывания кода, переживёт следующий релиз. Заодно одна модель отлично проверяет работу другой — adversarial review между вендорами ловит то, что каждый по отдельности пропускает.

Дешёвый лайфхак роутинга

Если не хочется строить сложный роутер — есть приём от создателя Claude Code (Boris Cherny): добавить одну строку в CLAUDE.md вроде «use a stronger subagent when you need more intelligence» и запускать базового агента на более дешёвой модели. Базовый агент сам поднимет старшую модель субагентом, когда упрётся. Дёшево, переносимо, работает в любой системе.

Коротко

  • Не «какая модель лучше», а «какая под эту задачу».
  • Sol выигрывает агентский кодинг и стоит втрое меньше Fable — но только до 272K.
  • Fable силён на длинных автономных прогонах, и за это платят отказами.
  • Роутер важнее любимой модели: фронтир двигается каждые недели.

Как этот расклад меняется дальше — ведём в канале @myshipstack.


Источники: OpenAI — прайс · Anthropic — прайс · System Card · Artificial Analysis · Terminal-Bench 2.1 · Composio · Claude Code — model config. Сверено 2026-07-15; вводная цена Sonnet 5 действует до 2026-08-31.