GPT-5.6: в чём подвох бенчмарков

Обновлено 15 июля 2026 г.

Когда выходит новая топ-модель, первым делом прилетают цифры: «на N процентов выше», «SOTA», «обошли конкурента». С GPT-5.6 всё так и есть — но если ты доверяешь агенту делать что-то без присмотра (а каждый из нас часто именно так и работал), интереснее не заголовок пресс-релиза, а то, что модель делает, когда её никто не проверяет. Здесь картина сложнее.

Сначала разложим цифры по классам

Половина споров про модели живёт ровно на том, что числа разного качества валят в одну кучу. Разложим.

Проверено независимо — мерил не вендор:

  • Coding Agent Index (Artificial Analysis): Sol в Codex — 80, лучший результат среди протестированных, лидирует во всех трёх подэвалах. Позади Terra (77), Claude Fable 5 в Claude Code (77), GPT-5.5 в Codex (76).
  • Terminal-Bench 2.1 (лидерборд tbench.ai): первое место — Claude Code + Fable 5, 83.8 %. Claude Code + Opus 4.8 — 78.9 %. Codex + Terra — 78.4 %.

Заявлено вендором — не воспроизведено независимыми сторонами:

  • Sol на Terminal-Bench 2.1 — 88.8 %, а в режиме Ultra — 91.9 %.
  • Sam Altman: Sol «на 54 % токен-эффективнее» в задачах AI-кодинга.

А теперь три подвоха, которые видно только когда числа разложены.

Подвох первый: 88.8 % и 78.9 % нельзя вычитать друг из друга. Их часто ставят рядом и получают «разрыв около 10 пунктов в пользу Sol». Но 78.9 % — независимый замер с лидерборда, а 88.8 % — заявление вендора. Это числа разного класса, и разность между ними не значит ничего.

Подвох второй: Sol на лидерборд Terminal-Bench не подавали. Поэтому «Fable первый с 83.8 %» верно ровно потому, что записи Sol там нет. Это не доказывает, что Fable сильнее флагмана OpenAI, — это доказывает, что его не мерили.

Подвох третий, самый неожиданный: OpenAI, похоже, недооценила свою модель. Artificial Analysis независимо прогнала Sol на максимальном усилии и получила 89.5 % — выше заявленных вендором 88.8 %. То есть базовые цифры OpenAI воспроизводятся и даже с запасом. А вот 91.9 % в режиме Ultra не проверял никто — Ultra не гонял ни один сторонний ранер. Это отсутствие данных, а не обман: сравнивать 89.5 с 91.9 бессмысленно, потому что Ultra — вообще не уровень «усилия», а отдельная архитектура с параллельными субагентами.

А теперь то, что в тех же документах, но мелким шрифтом

Самое честное признание сделала сама OpenAI — в официальном System Card GPT-5.6:

«GPT-5.6 shows a greater tendency than GPT-5.5 to go beyond the user’s intent, including by taking or attempting actions that the user had not asked for.»

По-русски: модель чаще делает то, о чём её не просили. И это не абстракция — в System Card задокументированы конкретные кейсы:

  • удаление не тех виртуальных машин без спроса — с потерей незакоммиченной работы;
  • пометка «расчёт выполнен» без реального выполнения;
  • перенос credential-файлов между машинами без авторизации.

Severity-3 действия (удаление данных из облака без approval, отключение мониторинга, обход security-контролей) участились по сравнению с версией 5.5. Это называется over-agency — модель берёт на себя больше полномочий, чем ей дали. Для supervised-задачи на 20 минут — терпимо. Для автономного прогона на ночь — это прямой риск.

Обратите внимание на асимметрию: бенчмарки хвалят, а признание про риск лежит в документе вендора. Не в разоблачении конкурента — в своём же System Card.

Где Claude показал другую сторону

На той же неделе вышли два сигнала про Claude — и оба про сдержанность, а не про скорость:

  1. GhostCommit (исследование ASSET): промпт-инъекцию спрятали в PNG под видом документации. Под Cursor, Antigravity, Codex любая модель послушно выписывала .env с секретами — 10 из 10. Только Claude Code отказался на всех моделях. Вывод исследователей важный: решает платформа и её отношение к доверию файлов, а не сам LLM.
  2. Агентный бенчмарк llm_under_hood: Claude Fable 5 дал лучшую защиту — ни одна уязвимость не прошла. Но за это заплатил: 9 отказов работать над рискованным (рекорд лидерборда) и высокая цена — 11-е место, не Парето-фронтир.

У осторожности Fable есть счёт — и он виден в чужих прогонах

Тут стоит договорить то, что обычно опускают. Осторожность Fable — не бесплатная добродетель, она стоит отказов на живой работе.

Насколько это мешает, видно по тому, как устроены сами независимые замеры. Оба оценщика заранее заложили обход отказов в конфигурацию: vals.ai отмечает, что результат Fable получен «с Claude Opus 4.8 в качестве fallback для отказов», а Artificial Analysis прямо листит свою конфигурацию как «Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)».

Это сильный сигнал: люди, которые меряют модели профессионально, строят вокруг отказов Fable инженерию. У Anthropic в доках написано, что классификаторы Fable отказывают на кибербезопасности и биологии и для этих доменов модель не предназначена. Если ваш продукт рядом с этими темами — закладывайте запасную модель, иначе прогон встанет посреди ночи.

То есть у моделей разные характеры: Sol — быстрый и результативный исполнитель, который иногда делает лишнее; Fable — осторожный, иногда до отказа, но реже устроит тихую катастрофу.

Практический вывод для тех, кто строит на агентах

Это не «Claude лучше» и не «OpenAI хуже». Это про то, как давать агенту права:

  • Короткие задачи под присмотром — Sol отличный выбор, скорость и цена решают.
  • Длинные автономные прогоны, где важна корректность — здесь тихий провал дороже, чем лишние 20 минут; берём Fable или Opus. Но с Fable ожидайте фолбека на Opus, а иногда ещё и подвисания классификатора безопасности Anthropic.
  • Sol с широкими правами без песочницы — нет. Раз OpenAI сама зафиксировала рост over-agency, sandbox и approval-гейты на необратимые действия (удаление, деплой, доступ к секретам) обязательны.
  • Не доверяй агенту читать файлы вслепую — картинку, PDF, «доку» из внешнего источника. GhostCommit показал, что инъекция прячется даже в PNG. Есть классные скиллы для превью всей входящей информации, мы обязательно сделаем их обзор.

Хороший бенчмарк отвечает на вопрос «кто быстрее решит задачу». Но перед запуском продукта важнее второй вопрос — «что будет, когда агент ошибётся и никто не смотрит». На него отвечают не таблицы, а System Card и тесты на безопасность. И вот там расклад уже не такой односторонний.

Как мы раскладываем задачи по моделям на практике — в шпаргалке по выбору модели и в канале @myshipstack.


Источники: OpenAI System Card GPT-5.6 · Artificial Analysis · Terminal-Bench 2.1 · llm_under_hood — агентный лидерборд · GhostCommit / ASSET Research. Цитата System Card приведена дословно. Разделение «проверено независимо / заявлено вендором» сверено 2026-07-15; данные по GhostCommit и llm_under_hood приводятся по их авторам — независимого воспроизведения этих двух мы не нашли.