GPT-5.6 против Claude: кто с кем на самом деле конкурирует

Обновлено 15 июля 2026 г.

Мы собираем продукты с AI каждый день, поэтому за релизами моделей следим ради простого вопроса: на чём дешевле и надёжнее довести гипотезу до денег. 9 июля OpenAI выкатила семейство GPT-5.6. Разбираем по официальным прайсам и независимым замерам — пресс-релизы тут плохой советчик.

Что вышло

GPT-5.6 — это три модели, и роли им назначила сама OpenAI:

  • Sol — флагман.
  • Terra — «capable lower-cost», средний тир.
  • Luna — самая быстрая и дешёвая.

Вместе с моделями OpenAI перекроила продукт: Codex стал просто ChatGPT (старый интерфейс уехал в «ChatGPT Classic»), появился ChatGPT Work и hosted-сайты — аналог «артефактов» Claude. AI-браузер Atlas закрывают.

Сколько это стоит

Сведём официальные прайсы обеих компаний — за 1 млн токенов, вход / выход:

МодельЦенаВендор
Claude Fable 5$10 / $50Anthropic
GPT-5.6 Sol$5 / $30OpenAI
Claude Opus 4.8$5 / $25Anthropic
Claude Sonnet 5$3 / $15 → $2 / $10 до 31.08Anthropic
GPT-5.6 Terra$2.5 / $15OpenAI
GPT-5.6 Luna$1 / $6OpenAI
Claude Haiku 4.5$1 / $5Anthropic

Из этой таблицы видно:

  • Opus 4.8 дешевле Sol. Вход одинаковый, $5 — на выходе $25 против $30.
  • Sonnet 5 сейчас дешевле Terra по обеим осям — $2/$10 против $2.5/$15. Это вводная цена Anthropic, она действует до 31 августа 2026, потом вернётся к $3/$15. То есть сегодня это правда, а через полтора месяца — уже нет.
  • Haiku 4.5 дешевле Luna. Тот же вход $1 — на выходе $5 против $6.

Нарратив «OpenAI дешевле Claude» на уровне прайса не корректен: дороже там только Fable — флагман под самые тяжёлые задачи.

Одна оговорка, без которой таблица врёт: цена за токен ≠ счёт в конце месяца. Токенайзеры у вендоров разные, поэтому один и тот же текст даёт разное число токенов. Сравнивать по прайсу можно модели одного вендора; между вендорами — только замером на своей нагрузке.

Ловушка, которой нет ни в одной таблице

Выше 272 тысяч входных токенов вся семья GPT-5.6 дорожает: ×2 на вход и ×1.5 на выход. Причём со всего запроса, а не с превышения.

до 272Kвыше 272K
Sol$5 / $30$10 / $45
Terra$2.5 / $15$5 / $22.50
Luna$1 / $6$2 / $9

Смотрите, что происходит с главным сравнением: на длинном контексте Sol стоит $10/$45 против $10/$50 у Fable 5. Разница в цене, ради которой всё затевалось, испаряется. У Anthropic весь миллион контекста идёт по стандартной цене — наценки за длину нет.

Там же вторая мелочь с большими последствиями: у GPT-5.6 запись в кэш стоит 1.25× от обычного входа, хотя на моделях до этой семьи была бесплатной. Скидка в 10 раз относится только к чтению кэша. Если пайплайн часто перезаписывает префикс — считайте заново.

Кто с кем конкурирует на самом деле

Тут самое интересное, и это не то, что пишут в обзорах. Возьмём независимый Intelligence Index от Artificial Analysis:

МодельИндекс
Fable 5 (max)60
GPT-5.6 Sol (max)59
GPT-5.6 Sol (xhigh)58
Claude Opus 4.8 (max)56
GPT-5.6 Terra (max)55
GPT-5.6 Luna (max)51

Sol метит не в Opus, а в Fable — и не дотягивает один пункт из шестидесяти. Один пункт — это не «на голову выше», это ноздря в ноздрю.

А на Coding Agent Index порядок разворачивается: Sol в Codex — 80, лучший результат среди всех протестированных, лидирует во всех трёх подэвалах. Позади Terra (77), Fable 5 в Claude Code (77) и GPT-5.5 в Codex (76).

И цена за задачу: $1.04 у Sol против $2.75 у Fable при сопоставимом интеллекте — разница в 2.6 раза. Это не единичный замер: hands-on Composio на DeepSwe независимо другой методикой получил у Sol и Fable одинаковые 69% pass rate при $3.47 против $9.18 — те же 2.65×. Две несвязанные методологии сошлись на одном числе.

Где Fable всё-таки первый

На независимом лидерборде Terminal-Bench 2.1 первое место у Claude Code + Fable 5 — 83.8%. Дальше Claude Code + Opus 4.8 (78.9%), Codex + Terra (78.4%), Codex + Luna (75.7%).

Только вот честная оговорка, без которой это читается неправильно: Sol на этот лидерборд не подавали. «Fable выше всех записей GPT-5.6» верно ровно потому, что записи Sol там нет. Это не доказывает, что Fable сильнее флагмана OpenAI.

Сама OpenAI заявляет для Sol в режиме Ultra 91.9% на том же бенчмарке. Проверить это не смог никто: Ultra не гонял ни один независимый ранер. Это отсутствие данных, а не опровержение — но и ссылаться на 91.9% как на измеренный факт нельзя. Показательно, что не-Ultra цифры OpenAI воспроизводятся: Artificial Analysis намерила Sol на xhigh 89.5% при заявленных вендором 88.8% — то есть даже чуть выше обещанного.

Ultra и Ultracode — это надстройки, а не модели

Тут стоит развести слои, потому что их постоянно путают.

Ultra — не уровень «усилия» модели, а мультиагентная архитектура: задача раскладывается на части, их разбирают параллельные субагенты. Прирост с 88.8% до 91.9% даёт именно она. В System Card GPT-5.6 слова «Ultra» нет вообще — там тестируют голые gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna.

Такой же приём мы уже видели у Anthropic: Ultracode — это настройка Claude Code, которая шлёт модели максимальное усилие и вдобавок заставляет её оркестрировать воркфлоу. В доках сказано прямо: «Ultracode is a Claude Code setting rather than a model effort level». И он не привязан к Fable — работает на любой модели с поддержкой xhigh: Fable 5, Opus 4.8, Opus 4.7, Sonnet 5.

Вывод для стека: оркестрация живёт в харнессе, а не в модели. Значит её можно собрать самому — и выбирать модель под роль, а не покупать чужую надстройку целиком. Мы так и делаем: план на модели поумнее, руки — на модели подешевле.

Плата за Fable, о которой не пишут

У Fable 5 есть цена помимо денег. Мышление у него не отключается, сырой ход рассуждений наружу не отдаётся, и требуется 30-дневное хранение данных — под zero-retention он просто не работает. А классификаторы безопасности отказывают на кибербезопасности и биологии; в доках Anthropic прямо сказано, что для этих доменов Fable не предназначен.

Насколько это мешает на практике — видно по тому, как устроены сами замеры. Оба независимых оценщика заранее заложили обход отказов в свои прогоны: vals.ai отмечает, что результат Fable получен «с Claude Opus 4.8 в качестве fallback для отказов», а Artificial Analysis листит свою конфигурацию как «Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)».

Если люди, которые меряют модели профессионально, строят вокруг отказов инженерию — закладывайте запасной Opus и вы.

И ещё: Fable не является моделью по умолчанию нигде. На Max и по API дефолт — Opus 4.8, на Pro — Sonnet 5. Fable включается только руками. Сама Anthropic пишет, что Fable — «не дефолтный путь апгрейда с Opus».

Про лимиты подписок: публичных данных нет

Отдельно скажем про то, чего мы не нашли, потому что это важнее красивой догадки.

Агентские задачи обычно гоняют через API, а разработку большинство ведёт на подписке — значит вопрос «сколько влезает в подписку» практичнее любого бенчмарка. Мы искали в двух заходах: сколько Opus, Fable и Sol реально помещается в неделю, как считаются недельные окна, с какого объёма API выгоднее подписки. Публичных данных нет. Ни цифр по Claude Pro и Max, ни живого замера «упёрся за столько-то часов», ни расчёта точки безубыточности. Не нашли — значит не пишем.

Один факт всё же есть, и он важный: 12 июля OpenAI временно сняла пятичасовое окно лимита для ChatGPT Work и Codex на планах Plus, Business и Pro — через три дня после запуска. Дата возврата не объявлена.

Что это значит на практике: пятичасового окна сейчас нет — но безлимита это не даёт. Недельные потолки остались в силе. То есть спринт стал длиннее, а неделя — нет. Если вы работаете на подписке, самый практичный совет ровно один: балансируйте недельный лимит между моделями, а не выжигайте одну. И держите в голове, что временное на то и временное.

Кому что: практический вывод

Правильный вопрос — не «кто лучше», а «что под какую задачу».

  • Агентский кодинг, где считаем деньги — Sol. Первое место на Coding Agent Index и в 2.6 раза дешевле за задачу, чем Fable.
  • Длинный контекст — Anthropic. Выше 272K Sol дорожает вдвое по входу и сравнивается с Fable по цене, а у Anthropic наценки за длину нет.
  • Дешёвый массовый объём — сравнивайте Luna ($1/$6) и Haiku 4.5 ($1/$5) на своей задаче: вход одинаковый, на выходе Haiku дешевле. Независимого сравнения этой пары мы не нашли — меряйте сами.
  • Осторожность там, где широкие права. В System Card OpenAI сама признаёт: GPT-5.6 чаще предыдущей версии выходит за рамки намерения пользователя в агентском кодинге. Sandbox и approval-гейты обязательны — подробнее в статье «GPT-5.6: в чём подвох бенчмарков».

Что делаем мы

Не лочимся на одну модель. Оркестрация — в харнессе, поэтому план собираем на модели поумнее, а руки отдаём подешевле. Одна модель отлично проверяет работу другой — adversarial review между вендорами ловит то, что каждый по отдельности пропускает. А пока топовые вендоры конкурируют так плотно, выигрывает пользователь.


Источники: OpenAI — прайс API · OpenAI — GPT-5.6 Sol · System Card · Anthropic — прайс · Claude Code — model config · Artificial Analysis · Terminal-Bench 2.1 · Composio. Цены и замеры сверены 2026-07-15; вводная цена Sonnet 5 действует до 2026-08-31.