GPT-5.6 против Claude: кто с кем на самом деле конкурирует
Мы собираем продукты с AI каждый день, поэтому за релизами моделей следим ради простого вопроса: на чём дешевле и надёжнее довести гипотезу до денег. 9 июля OpenAI выкатила семейство GPT-5.6. Разбираем по официальным прайсам и независимым замерам — пресс-релизы тут плохой советчик.
Что вышло
GPT-5.6 — это три модели, и роли им назначила сама OpenAI:
- Sol — флагман.
- Terra — «capable lower-cost», средний тир.
- Luna — самая быстрая и дешёвая.
Вместе с моделями OpenAI перекроила продукт: Codex стал просто ChatGPT (старый интерфейс уехал в «ChatGPT Classic»), появился ChatGPT Work и hosted-сайты — аналог «артефактов» Claude. AI-браузер Atlas закрывают.
Сколько это стоит
Сведём официальные прайсы обеих компаний — за 1 млн токенов, вход / выход:
| Модель | Цена | Вендор |
|---|---|---|
| Claude Fable 5 | $10 / $50 | Anthropic |
| GPT-5.6 Sol | $5 / $30 | OpenAI |
| Claude Opus 4.8 | $5 / $25 | Anthropic |
| Claude Sonnet 5 | $3 / $15 → $2 / $10 до 31.08 | Anthropic |
| GPT-5.6 Terra | $2.5 / $15 | OpenAI |
| GPT-5.6 Luna | $1 / $6 | OpenAI |
| Claude Haiku 4.5 | $1 / $5 | Anthropic |
Из этой таблицы видно:
- Opus 4.8 дешевле Sol. Вход одинаковый, $5 — на выходе $25 против $30.
- Sonnet 5 сейчас дешевле Terra по обеим осям — $2/$10 против $2.5/$15. Это вводная цена Anthropic, она действует до 31 августа 2026, потом вернётся к $3/$15. То есть сегодня это правда, а через полтора месяца — уже нет.
- Haiku 4.5 дешевле Luna. Тот же вход $1 — на выходе $5 против $6.
Нарратив «OpenAI дешевле Claude» на уровне прайса не корректен: дороже там только Fable — флагман под самые тяжёлые задачи.
Одна оговорка, без которой таблица врёт: цена за токен ≠ счёт в конце месяца. Токенайзеры у вендоров разные, поэтому один и тот же текст даёт разное число токенов. Сравнивать по прайсу можно модели одного вендора; между вендорами — только замером на своей нагрузке.
Ловушка, которой нет ни в одной таблице
Выше 272 тысяч входных токенов вся семья GPT-5.6 дорожает: ×2 на вход и ×1.5 на выход. Причём со всего запроса, а не с превышения.
| до 272K | выше 272K | |
|---|---|---|
| Sol | $5 / $30 | $10 / $45 |
| Terra | $2.5 / $15 | $5 / $22.50 |
| Luna | $1 / $6 | $2 / $9 |
Смотрите, что происходит с главным сравнением: на длинном контексте Sol стоит $10/$45 против $10/$50 у Fable 5. Разница в цене, ради которой всё затевалось, испаряется. У Anthropic весь миллион контекста идёт по стандартной цене — наценки за длину нет.
Там же вторая мелочь с большими последствиями: у GPT-5.6 запись в кэш стоит 1.25× от обычного входа, хотя на моделях до этой семьи была бесплатной. Скидка в 10 раз относится только к чтению кэша. Если пайплайн часто перезаписывает префикс — считайте заново.
Кто с кем конкурирует на самом деле
Тут самое интересное, и это не то, что пишут в обзорах. Возьмём независимый Intelligence Index от Artificial Analysis:
| Модель | Индекс |
|---|---|
| Fable 5 (max) | 60 |
| GPT-5.6 Sol (max) | 59 |
| GPT-5.6 Sol (xhigh) | 58 |
| Claude Opus 4.8 (max) | 56 |
| GPT-5.6 Terra (max) | 55 |
| GPT-5.6 Luna (max) | 51 |
Sol метит не в Opus, а в Fable — и не дотягивает один пункт из шестидесяти. Один пункт — это не «на голову выше», это ноздря в ноздрю.
А на Coding Agent Index порядок разворачивается: Sol в Codex — 80, лучший результат среди всех протестированных, лидирует во всех трёх подэвалах. Позади Terra (77), Fable 5 в Claude Code (77) и GPT-5.5 в Codex (76).
И цена за задачу: $1.04 у Sol против $2.75 у Fable при сопоставимом интеллекте — разница в 2.6 раза. Это не единичный замер: hands-on Composio на DeepSwe независимо другой методикой получил у Sol и Fable одинаковые 69% pass rate при $3.47 против $9.18 — те же 2.65×. Две несвязанные методологии сошлись на одном числе.
Где Fable всё-таки первый
На независимом лидерборде Terminal-Bench 2.1 первое место у Claude Code + Fable 5 — 83.8%. Дальше Claude Code + Opus 4.8 (78.9%), Codex + Terra (78.4%), Codex + Luna (75.7%).
Только вот честная оговорка, без которой это читается неправильно: Sol на этот лидерборд не подавали. «Fable выше всех записей GPT-5.6» верно ровно потому, что записи Sol там нет. Это не доказывает, что Fable сильнее флагмана OpenAI.
Сама OpenAI заявляет для Sol в режиме Ultra 91.9% на том же бенчмарке. Проверить это не смог никто: Ultra не гонял ни один независимый ранер. Это отсутствие данных, а не опровержение — но и ссылаться на 91.9% как на измеренный факт нельзя. Показательно, что не-Ultra цифры OpenAI воспроизводятся: Artificial Analysis намерила Sol на xhigh 89.5% при заявленных вендором 88.8% — то есть даже чуть выше обещанного.
Ultra и Ultracode — это надстройки, а не модели
Тут стоит развести слои, потому что их постоянно путают.
Ultra — не уровень «усилия» модели, а мультиагентная архитектура: задача
раскладывается на части, их разбирают параллельные субагенты. Прирост с 88.8% до
91.9% даёт именно она. В System Card GPT-5.6 слова «Ultra» нет вообще — там тестируют
голые gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna.
Такой же приём мы уже видели у Anthropic: Ultracode — это настройка Claude Code,
которая шлёт модели максимальное усилие и вдобавок заставляет её оркестрировать
воркфлоу. В доках сказано прямо: «Ultracode is a Claude Code setting rather than a
model effort level». И он не привязан к Fable — работает на любой модели с
поддержкой xhigh: Fable 5, Opus 4.8, Opus 4.7, Sonnet 5.
Вывод для стека: оркестрация живёт в харнессе, а не в модели. Значит её можно собрать самому — и выбирать модель под роль, а не покупать чужую надстройку целиком. Мы так и делаем: план на модели поумнее, руки — на модели подешевле.
Плата за Fable, о которой не пишут
У Fable 5 есть цена помимо денег. Мышление у него не отключается, сырой ход рассуждений наружу не отдаётся, и требуется 30-дневное хранение данных — под zero-retention он просто не работает. А классификаторы безопасности отказывают на кибербезопасности и биологии; в доках Anthropic прямо сказано, что для этих доменов Fable не предназначен.
Насколько это мешает на практике — видно по тому, как устроены сами замеры. Оба независимых оценщика заранее заложили обход отказов в свои прогоны: vals.ai отмечает, что результат Fable получен «с Claude Opus 4.8 в качестве fallback для отказов», а Artificial Analysis листит свою конфигурацию как «Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)».
Если люди, которые меряют модели профессионально, строят вокруг отказов инженерию — закладывайте запасной Opus и вы.
И ещё: Fable не является моделью по умолчанию нигде. На Max и по API дефолт — Opus 4.8, на Pro — Sonnet 5. Fable включается только руками. Сама Anthropic пишет, что Fable — «не дефолтный путь апгрейда с Opus».
Про лимиты подписок: публичных данных нет
Отдельно скажем про то, чего мы не нашли, потому что это важнее красивой догадки.
Агентские задачи обычно гоняют через API, а разработку большинство ведёт на подписке — значит вопрос «сколько влезает в подписку» практичнее любого бенчмарка. Мы искали в двух заходах: сколько Opus, Fable и Sol реально помещается в неделю, как считаются недельные окна, с какого объёма API выгоднее подписки. Публичных данных нет. Ни цифр по Claude Pro и Max, ни живого замера «упёрся за столько-то часов», ни расчёта точки безубыточности. Не нашли — значит не пишем.
Один факт всё же есть, и он важный: 12 июля OpenAI временно сняла пятичасовое окно лимита для ChatGPT Work и Codex на планах Plus, Business и Pro — через три дня после запуска. Дата возврата не объявлена.
Что это значит на практике: пятичасового окна сейчас нет — но безлимита это не даёт. Недельные потолки остались в силе. То есть спринт стал длиннее, а неделя — нет. Если вы работаете на подписке, самый практичный совет ровно один: балансируйте недельный лимит между моделями, а не выжигайте одну. И держите в голове, что временное на то и временное.
Кому что: практический вывод
Правильный вопрос — не «кто лучше», а «что под какую задачу».
- Агентский кодинг, где считаем деньги — Sol. Первое место на Coding Agent Index и в 2.6 раза дешевле за задачу, чем Fable.
- Длинный контекст — Anthropic. Выше 272K Sol дорожает вдвое по входу и сравнивается с Fable по цене, а у Anthropic наценки за длину нет.
- Дешёвый массовый объём — сравнивайте Luna ($1/$6) и Haiku 4.5 ($1/$5) на своей задаче: вход одинаковый, на выходе Haiku дешевле. Независимого сравнения этой пары мы не нашли — меряйте сами.
- Осторожность там, где широкие права. В System Card OpenAI сама признаёт: GPT-5.6 чаще предыдущей версии выходит за рамки намерения пользователя в агентском кодинге. Sandbox и approval-гейты обязательны — подробнее в статье «GPT-5.6: в чём подвох бенчмарков».
Что делаем мы
Не лочимся на одну модель. Оркестрация — в харнессе, поэтому план собираем на модели поумнее, а руки отдаём подешевле. Одна модель отлично проверяет работу другой — adversarial review между вендорами ловит то, что каждый по отдельности пропускает. А пока топовые вендоры конкурируют так плотно, выигрывает пользователь.
Источники: OpenAI — прайс API · OpenAI — GPT-5.6 Sol · System Card · Anthropic — прайс · Claude Code — model config · Artificial Analysis · Terminal-Bench 2.1 · Composio. Цены и замеры сверены 2026-07-15; вводная цена Sonnet 5 действует до 2026-08-31.