
Что скрывается за цифрой 52,6%
Terminal-Bench-Science 0.1 — действительно новый и амбициозный бенчмарк: 70 экспертно составленных научных задач из биологии, физики, наук о Земле, математики и инженерии, каждая прогоняется тремя независимыми попытками, а результат оценивается по конкретным артефактам — коду, симуляциям, доказательствам, аналитическим отчётам. Это не тест на знания, а проверка того, способен ли AI-агент довести исследовательский workflow до проверяемого результата. Идея хорошая: наука выигрывает, если рутинные, но трудоёмкие этапы возьмёт на себя агент, оставляя людям формулировку гипотез и интерпретацию данных.
Но здесь и начинаются нюансы. В самом первом релизе бенчмарка, опубликованном 27 августа 2026 года, лидером была Claude Opus 5 с результатом 30,0%, следом GPT-5.6 Sol — 22,4%, и Fable 5 — 21,4%. Через несколько дней Anthropic в анонсе Fable 5.1 привела немного другие цифры для тех же старых моделей — 29,0% для Opus 5 и 24,7% для Fable 5. А ещё через три недели независимый агрегатор бенчмарков зафиксировал совсем иную картину: в снапшоте на 22 сентября лидером стала GPT-6 Astra с 68,1%, Fable 5.1 — на втором месте с 40,0%, Opus 5 — на третьем с 30,0%. То есть один и тот же бенчмарк с одним и тем же названием версии выдаёт для одной и той же модели три разных числа в зависимости от того, кто и когда его прогонял.
Это не подвох и не ошибка — это свойство метрики. Каждая строка в таблице TB-Science — не оценка модели саму по себе, а оценка связки «модель + агентный harness + среда выполнения»: то есть то, какой инструмент запуска использовался, какие настройки reasoning были включены, какая версия окружения. Разработчики бенчмарка сами предупреждают, что читать таблицу нужно как версионированную системную оценку, а не как чистый показатель способностей базовой модели. Иными словами, поменяйте агента вокруг той же модели — и число сдвинется на десятки процентных пунктов, даже если сама модель не изменилась ни на бит.
Пять режимов — пять разных моделей по факту
Именно эту хрупкость headline-числа наглядно показывает пеликаний тест. У Fable 5.1 нет возможности вообще отключить «мышление» — есть только пять уровней усилия: low, medium, high, xhigh и max. Автор теста прогнал один и тот же запрос через все пять и зафиксировал не только качество картинки, но и то, сколько это стоило.
| Режим | Токены на выходе | Время ответа | Стоимость запроса | Что происходило с рассуждениями |
|---|---|---|---|---|
| low | ~2000 | ~24 сек | ~10 центов | Следов рассуждений почти нет, результат неотличим от medium |
| medium | ~1980 | ~23 сек | ~10 центов | Тоже без видимого «мышления», разница с low в пределах погрешности |
| high | ~2600 | ~30 сек | ~13 центов | Появляется короткий план композиции, качество чуть выше |
| xhigh | ~36 800 | ~7 мин 51 сек | ~1,83 $ | Долгие рассуждения о деталях позы и пропорций, заметный скачок в детализации |
| max | ~65 900 | ~13 мин 54 сек | ~3,30 $ | Подробный внутренний диалог о шлеме, перьях, корзинке с рыбой — лучший результат серии |
Разница между low и medium оказалась настолько малой, что модель фактически «пропустила» рассуждения на обоих уровнях. А вот прыжок с high на xhigh — это не постепенное улучшение, а переход в другую экономику использования: время ответа выросло с 30 секунд до почти 8 минут, а цена — в 14 раз. И это стабильная закономерность для больших языковых моделей: рост «усилия мышления» почти всегда тянет за собой рост числа токенов, времени и стоимости, но не гарантирует пропорциональный рост качества — где-то отдача есть, где-то её почти нет.
Здесь стоит сделать честную оговорку: SVG-пеликан — забавный, наглядный, но узкий пример. Он ничего не доказывает о том, как модель справится с анализом данных, кодом или юридическим текстом. Ценность теста не в том, «хороша ли модель», а в том, что он обнажает механику: одна и та же модель на одном и том же запросе может вести себя как пять разных инструментов, если считать не только результат, но и его цену.
Как читать громкий бенчмарк, не обманывая себя
Если сложить историю про Terminal-Bench-Science и историю про пять режимов reasoning, получается общая схема, применимая к почти любому громкому AI-анонсу.
flowchart TD A[Заявление в анонсе] --> B[Процент на бенчмарке] B --> C[Модель плюс harness плюс среда] C --> D[Настройка reasoning effort] D --> E[Реальные токены время и цена] E --> F[Практический вывод для задачи]
Каждая стрелка здесь — точка, где число может «поплыть». Заявление превращается в процент только при конкретной настройке агента; процент зависит от того, какой harness обвязывает модель; harness обычно запускается с определённым уровнем reasoning; а уровень reasoning напрямую определяет, во сколько раз вырастут время и счёт. И только пройдя всю цепочку, можно сделать содержательный вывод — применим ли этот результат к вашей задаче.
Разработчики самого TB-Science прямо признают ограничения: бенчмарк остаётся тяжёлым (лучшие результаты первого релиза не превышали 30%), версия 0.1 — намеренно временная и будет обновляться, а показатели по разным научным доменам расходятся сильно — где-то Opus 5 лидирует с большим отрывом, где-то Fable 5 выходит вперёд именно в математических задачах. Это разумная методологическая честность, но она плохо переживает пересказ в маркетинговом слайде, где остаётся только одна цифра — 52,6%.
Что с этим делать читателю
Ни один из фактов здесь не означает, что Fable 5.1 плохая или хорошая модель в целом — таких выводов источники просто не позволяют сделать. Один тест с пеликаном не измеряет пользу модели для типичной работы, а один процент на новом научном бенчмарке не измеряет реальную исследовательскую продуктивность без множества оговорок об окружении запуска.
Но из этой истории можно вынести рабочую привычку: увидев громкий процент в анонсе модели, стоит спросить не «насколько это высоко», а «на каком harness, при какой настройке reasoning и по какой цене это было получено». Собственные рекомендации Anthropic по Fable 5.1 подсказывают то же самое — уровень усилия мышления советуют подбирать не по абстрактной шкале low–max, а тестируя на своих характерных задачах, поскольку смысл этих уровней сильно зависит от контекста использования. Для пользователя это куда полезнее любого лидерборда: не искать модель, которая «лучше всех», а понимать, в каком режиме конкретная модель даёт разумное соотношение результата и цены именно для вашей задачи — будь то научный workflow или обычный SVG-пеликан.


