Пеликан на велосипеде против научного бенчмарка: что на самом деле показал релиз Claude Fable 5.1

Анонс новой модели почти всегда звучит одинаково: «новый стандарт», рекордный процент, таблица, где старая версия проигрывает новой. Именно так Anthropic представила Claude Fable 5.1, сделав акцент на научной работе и заявив о результате 52,6% на свежем Terminal-Bench-Science 0.1 — против 24,7% у предыдущей Fable 5, 29,0% у Opus 5 и 22,4% у GPT-5.6 Sol. Но самый показательный тест этого релиза оказался куда скромнее: обычный запрос «нарисуй SVG пеликана на велосипеде», прогнанный через все пять уровней «усилия мышления» модели. Разброс результатов там оказался таким, что заставляет иначе взглянуть и на громкий научный процент.

Сравнение результатов Claude Fable 5.1 на бенчмарке и примере с пеликаном на велосипеде, показывающее разницу между режимами мышления

Что скрывается за цифрой 52,6%

Terminal-Bench-Science 0.1 — действительно новый и амбициозный бенчмарк: 70 экспертно составленных научных задач из биологии, физики, наук о Земле, математики и инженерии, каждая прогоняется тремя независимыми попытками, а результат оценивается по конкретным артефактам — коду, симуляциям, доказательствам, аналитическим отчётам. Это не тест на знания, а проверка того, способен ли AI-агент довести исследовательский workflow до проверяемого результата. Идея хорошая: наука выигрывает, если рутинные, но трудоёмкие этапы возьмёт на себя агент, оставляя людям формулировку гипотез и интерпретацию данных.

Но здесь и начинаются нюансы. В самом первом релизе бенчмарка, опубликованном 27 августа 2026 года, лидером была Claude Opus 5 с результатом 30,0%, следом GPT-5.6 Sol — 22,4%, и Fable 5 — 21,4%. Через несколько дней Anthropic в анонсе Fable 5.1 привела немного другие цифры для тех же старых моделей — 29,0% для Opus 5 и 24,7% для Fable 5. А ещё через три недели независимый агрегатор бенчмарков зафиксировал совсем иную картину: в снапшоте на 22 сентября лидером стала GPT-6 Astra с 68,1%, Fable 5.1 — на втором месте с 40,0%, Opus 5 — на третьем с 30,0%. То есть один и тот же бенчмарк с одним и тем же названием версии выдаёт для одной и той же модели три разных числа в зависимости от того, кто и когда его прогонял.

Это не подвох и не ошибка — это свойство метрики. Каждая строка в таблице TB-Science — не оценка модели саму по себе, а оценка связки «модель + агентный harness + среда выполнения»: то есть то, какой инструмент запуска использовался, какие настройки reasoning были включены, какая версия окружения. Разработчики бенчмарка сами предупреждают, что читать таблицу нужно как версионированную системную оценку, а не как чистый показатель способностей базовой модели. Иными словами, поменяйте агента вокруг той же модели — и число сдвинется на десятки процентных пунктов, даже если сама модель не изменилась ни на бит.

Пять режимов — пять разных моделей по факту

Именно эту хрупкость headline-числа наглядно показывает пеликаний тест. У Fable 5.1 нет возможности вообще отключить «мышление» — есть только пять уровней усилия: low, medium, high, xhigh и max. Автор теста прогнал один и тот же запрос через все пять и зафиксировал не только качество картинки, но и то, сколько это стоило.

Режим Токены на выходе Время ответа Стоимость запроса Что происходило с рассуждениями
low ~2000 ~24 сек ~10 центов Следов рассуждений почти нет, результат неотличим от medium
medium ~1980 ~23 сек ~10 центов Тоже без видимого «мышления», разница с low в пределах погрешности
high ~2600 ~30 сек ~13 центов Появляется короткий план композиции, качество чуть выше
xhigh ~36 800 ~7 мин 51 сек ~1,83 $ Долгие рассуждения о деталях позы и пропорций, заметный скачок в детализации
max ~65 900 ~13 мин 54 сек ~3,30 $ Подробный внутренний диалог о шлеме, перьях, корзинке с рыбой — лучший результат серии

Разница между low и medium оказалась настолько малой, что модель фактически «пропустила» рассуждения на обоих уровнях. А вот прыжок с high на xhigh — это не постепенное улучшение, а переход в другую экономику использования: время ответа выросло с 30 секунд до почти 8 минут, а цена — в 14 раз. И это стабильная закономерность для больших языковых моделей: рост «усилия мышления» почти всегда тянет за собой рост числа токенов, времени и стоимости, но не гарантирует пропорциональный рост качества — где-то отдача есть, где-то её почти нет.

Здесь стоит сделать честную оговорку: SVG-пеликан — забавный, наглядный, но узкий пример. Он ничего не доказывает о том, как модель справится с анализом данных, кодом или юридическим текстом. Ценность теста не в том, «хороша ли модель», а в том, что он обнажает механику: одна и та же модель на одном и том же запросе может вести себя как пять разных инструментов, если считать не только результат, но и его цену.

Как читать громкий бенчмарк, не обманывая себя

Если сложить историю про Terminal-Bench-Science и историю про пять режимов reasoning, получается общая схема, применимая к почти любому громкому AI-анонсу.

flowchart TD
A[Заявление в анонсе] --> B[Процент на бенчмарке]
B --> C[Модель плюс harness плюс среда]
C --> D[Настройка reasoning effort]
D --> E[Реальные токены время и цена]
E --> F[Практический вывод для задачи]

Каждая стрелка здесь — точка, где число может «поплыть». Заявление превращается в процент только при конкретной настройке агента; процент зависит от того, какой harness обвязывает модель; harness обычно запускается с определённым уровнем reasoning; а уровень reasoning напрямую определяет, во сколько раз вырастут время и счёт. И только пройдя всю цепочку, можно сделать содержательный вывод — применим ли этот результат к вашей задаче.

Разработчики самого TB-Science прямо признают ограничения: бенчмарк остаётся тяжёлым (лучшие результаты первого релиза не превышали 30%), версия 0.1 — намеренно временная и будет обновляться, а показатели по разным научным доменам расходятся сильно — где-то Opus 5 лидирует с большим отрывом, где-то Fable 5 выходит вперёд именно в математических задачах. Это разумная методологическая честность, но она плохо переживает пересказ в маркетинговом слайде, где остаётся только одна цифра — 52,6%.

Что с этим делать читателю

Ни один из фактов здесь не означает, что Fable 5.1 плохая или хорошая модель в целом — таких выводов источники просто не позволяют сделать. Один тест с пеликаном не измеряет пользу модели для типичной работы, а один процент на новом научном бенчмарке не измеряет реальную исследовательскую продуктивность без множества оговорок об окружении запуска.

Но из этой истории можно вынести рабочую привычку: увидев громкий процент в анонсе модели, стоит спросить не «насколько это высоко», а «на каком harness, при какой настройке reasoning и по какой цене это было получено». Собственные рекомендации Anthropic по Fable 5.1 подсказывают то же самое — уровень усилия мышления советуют подбирать не по абстрактной шкале low–max, а тестируя на своих характерных задачах, поскольку смысл этих уровней сильно зависит от контекста использования. Для пользователя это куда полезнее любого лидерборда: не искать модель, которая «лучше всех», а понимать, в каком режиме конкретная модель даёт разумное соотношение результата и цены именно для вашей задачи — будь то научный workflow или обычный SVG-пеликан.

Источники

  1. Claude Fable 5.1 made me a really nice animated pelican
  2. TERMINAL-BENCH
Поделиться:
Telegram Facebook X VK
Scroll to Top