
Что на самом деле произошло
Кимi K3 — это mixture-of-experts модель: у неё огромное общее число параметров, но на каждый токен активируется лишь малая часть сети — 16 экспертов из 896, то есть меньше двух процентов от общего пула. Это архитектурный трюк, который позволяет наращивать масштаб без пропорционального роста вычислений на каждый запрос: модель как бы держит в резерве множество специализированных «подсетей» и вызывает только нужные. Именно поэтому сравнение «2,8 триллиона против 1,6 триллиона у DeepSeek V4 Pro» само по себе мало что говорит о реальной мощности — важнее, сколько из этих параметров модель использует одновременно и насколько эффективно.
Главный результат, вокруг которого выстроен хайп, — первое место в живом рейтинге Arena WebDev, который измеряет сложные агентные задачи фронтенд-разработки: 1679 очков на основе 1757 голосов. Это реальный и проверяемый сигнал — но с оговорками. Рейтинг был помечен как предварительный, с интервалом погрешности ±17, то есть позиция может измениться по мере накопления голосов. И даже сама Moonshot в своём анонсе признала, что общая производительность K3 всё ещё уступает Claude Fable 5 и GPT-5.6 Sol — компания честно назвала модели, которые обходят её собственную.
Почему один лидерборд — это не «модель лучше всех»
Бенчмарки для языковых моделей почти никогда измеряют одну абстрактную «умность» — они измеряют пригодность к конкретному классу задач. Kimi K3 действительно сильна во фронтенд-кодинге и в ряде агентных сценариев вроде автоматизации браузера и работы с таблицами, где она обходит и Fable 5, и GPT-5.6 Sol. Но на самом сложном тесте агентного кодинга, DeepSWE, модель занимает лишь третье место, уступая обоим этим конкурентам. Иными словами, K3 выигрывает на широте — она хороша в разных вещах — но проигрывает на глубине в самой требовательной задаче. Это принципиально другая история, чем «модель, которая обходит всех».
Дополнительная сложность в том, что тестовые методики (harness) у разных лабораторий не унифицированы: одни модели тестируются через Kimi Code, другие через Claude Code или Codex, часть результатов взята с открытых лидербордов, часть — пересчитана самой Moonshot. Это не делает цифры бессмысленными, но не позволяет сделать чистый вывод, что разница в баллах отражает только качество модели, а не выбранный инструментарий.
Открытые веса — обещание, а не факт
Moonshot называет Kimi K3 «первой открытой моделью 3T-класса» и крупнейшей open-weight моделью на рынке. Но на момент запуска веса модели не были опубликованы: компания пообещала выложить их к 27 июля, спустя примерно десять дней после анонса. До этой даты у модели нет ни файла лицензии, ни репозитория, ни руководства по развёртыванию. Практика последнего года у той же компании (лицензия K2.7-Code с оговоркой об атрибуции при достижении определённого числа пользователей или выручки) даёт ориентир, но не гарантию того, какие условия получит K3.
Здесь стоит разделить понятия. «Открытые веса» — это возможность скачать файл модели и запускать её самостоятельно. «Открытый исходный код» в полном смысле подразумевает ещё и открытые обучающие данные, воспроизводимые пайплайны, permissive-лицензию и техническую документацию. Даже если веса появятся в срок, Moonshot рекомендует для развёртывания supernode-конфигурации на 64 и более ускорителей — это не «модель, которую можно запустить на рабочей станции», а инфраструктура корпоративного уровня. Открытость весов не равна доступности модели для рядового разработчика.
Сколько это стоит на самом деле
Официальная цена API выглядит привлекательно: $0,30 за миллион токенов входа при кэш-хите, $3 за миллион при промахе кэша и $15 за миллион выходных токенов — против $50 за миллион выходных токенов у Fable 5. Но итоговый счёт зависит не от цены токена, а от того, сколько токенов реально уходит на задачу. Независимый индекс Artificial Analysis зафиксировал, что K3 склонна генерировать длинные ответы и работает на скорости около 62 токенов в секунду — заметно ниже медианы 72,7 для моделей своего ценового сегмента. Многословная модель со скромной скоростью может обойтись дороже конкурента с более высокой номинальной ценой за токен, если ей требуется больше токенов и больше времени на ту же задачу.
Что подтверждено, а что остаётся заявлением
| Аспект | Что подтверждено | Что остаётся спорным или неполным |
|---|---|---|
| Фронтенд-кодинг | Первое место в живом рейтинге Arena WebDev | Предварительный статус, погрешность ±17 |
| Общий индекс интеллекта | 4-е место из 189 моделей по Artificial Analysis | Не равно лидерству во всех типах задач |
| Скорость вывода | Ниже медианы сегмента, ~62 токена/сек | Влияние на реальную стоимость зависит от сценария |
| Открытые веса | Дата обещана — 27 июля | Лицензия, репозиторий и гайд по развёртыванию не опубликованы |
| Агентная автономность | Есть демонстрации сложных многочасовых проектов | В основном vendor-run кейсы, не независимые тесты |
Демонстрации против продакшена
Самый показательный материал вокруг релиза — не рекламный кейс, а практический тест одного из ранних пользователей, который дал K3 работать в реальном продукте на базе Kimi Code. Модель успешно прочитала документацию, разобрала пользовательские заявки, реализовала семь изменений и прогнала CI. Но при работе с функцией ранжирования трендов она повторила существующий шаблон загрузки и отправила в очередь около 9000 элементов туда, где параллельно могло обрабатываться только шесть — сайт почти час оставался без свежего контента, хотя тесты формально прошли, потому что сбой был архитектурным, а не синтаксическим. Это ровно та ловушка, о которой стоит помнить: длинный контекст и агентность помогают модели удерживать план действий, но не заменяют явных операционных ограничений — лимитов очередей, бюджетов и наблюдаемости, которые всё равно должен задать человек.
Что с этим делать читателю
Kimi K3 — это масштабный и во многих отношениях впечатляющий релиз: сильный результат в конкретном лидерборде, амбициозная архитектура и заявленная низкая цена токенов заслуживают внимания. Но ни один из этих фактов сам по себе не означает, что модель лучше конкурентов в целом, что она уже полноценно открыта или что она обязательно дешевле в реальной работе. Пока веса не опубликованы, лицензия не подтверждена, а независимые замеры показывают смешанную картину — умную, но не быструю модель, — разумнее относиться к громким сравнениям как к сигналу для собственной проверки, а не как к завершённому вердикту.


