Стойка вместо чипа: зачем AMD бросает Nvidia вызов не характеристиками, а целой AI-инфраструктурой

Когда компания выводит на рынок новый ускоритель, вопрос обычно звучит просто: он быстрее конкурента или нет? С запуском Helios AMD впервые сменила саму рамку спора. Теперь на кону не отдельный чип, а целая стойка — процессоры, GPU, сетевые карты, охлаждение и программный стек, собранные в единую систему. И именно это меняет правила игры: сравнивать приходится не транзисторы, а способность превратить открытую архитектуру в такую же надёжную инфраструктуру, какой Nvidia стала для рынка за последние годы.

Стойка AMD Helios с серверами и охлаждением как пример AI-инфраструктуры, а не отдельного чипа, в сравнении с подходом Nvidia

Стойка как новая единица конкуренции

Rack-scale AI — подход, при котором вся стойка проектируется как единый вычислительный организм, а не набор соединённых кабелями серверов. Память, сеть, охлаждение и питание рассчитываются заранее под конкретную нагрузку, а не докручиваются постфактум. Nvidia приучила рынок именно к такому масштабу мышления: покупатели крупных AI-кластеров давно оценивают не GPU, а целые системы вроде NVL72.

Helios — первый ответ AMD на этом уровне. Это 72 ускорителя Instinct MI455X, процессоры EPYC и сетевые чипы Pensando, собранные в открытой стойке формата Open Rack Wide, который Meta предложила Open Compute Project. Важная деталь, которую легко упустить за громкими цифрами: Helios — это референсный дизайн, а не готовый серийный сервер, который можно просто заказать по каталогу. AMD передаёт чертёж партнёрам-производителям, а те уже собирают из него собственные брендированные системы. Это принципиально другая модель дистрибуции, чем цельный, вертикально закрытый продукт Nvidia.

Что AMD показала на Advancing AI

На мероприятии Advancing AI в Сан-Франциско AMD провела едва ли не самую плотную серию анонсов за последние годы: инфраструктура для облаков и дата-центров, AI-устройства для десктопов, решения для робототехники. Но центральным событием стал именно официальный запуск Helios — переход от прошлогоднего превью к реальной поставке.

На сцену вышли не абстрактные "партнёры", а Anthropic, OpenAI, Meta и корпоративные заказчики уровня AT&T. Глава AMD Лиза Су подчеркнула, что Helios разрабатывался в тесном контакте с первыми клиентами — деталь важная, потому что именно ранняя обратная связть от реальных нагрузок отличает продукт, спроектированный "для витрины", от продукта, спроектированного для эксплуатации.

Здесь стоит развести два разных факта, которые в новостных заголовках легко слипаются. Первый: AMD объявила о начале отгрузок Helios в этом квартале. Второй: по данным официальной страницы продукта, массовые (volume) развёртывания у партнёров ожидаются лишь во второй половине 2026 года. Это не противоречие — это две разные стадии одного процесса: начать поставлять систему первым интеграторам и обеспечить её присутствие в дата-центрах в промышленных объёмах — разные по сложности задачи.

Четыре уровня, на которых идёт битва

Главное преимущество Nvidia — не самый быстрый чип сам по себе, а контроль над всем стеком: процессоры, сеть NVLink, библиотеки CUDA, инструменты разработки и сертифицированные конфигурации серверов. AMD пытается атаковать это преимущество не в одной точке, а сразу на нескольких уровнях.

На уровне железа AMD заявляет о превосходстве Helios над готовящейся системой Nvidia Vera Rubin NVL72 по пиковой производительности, ёмкости памяти HBM4 и пропускной способности. На уровне сети AMD и партнёры продвигают открытые стандарты UALink и Ultra Ethernet как альтернативу закрытому NVLink. На уровне софта — новую версию стека ROCm под названием ROCm.ai, которая должна с помощью AI-ассистентов облегчить перенос кода, написанного под CUDA. И, наконец, на уровне экосистемы — партнёрства вроде связки с Cerebras, где инференс распределяется между двумя разными архитектурами: Helios обрабатывает длинный контекст и промпты, а вафельные процессоры Cerebras — генерацию токенов.

Показательный пример из софтового слоя — история, которую на мероприятии рассказала Anthropic: инженер оставил модель Claude автономно настраивать производительность на чипе Instinct MI355X на выходные, и в понедельник получил рабочую, стабильно улучшающуюся кривую производительности. Это интересный сигнал зрелости инструментов автотюнинга, но это единичный кейс, а не статистика по десяткам продуктивных внедрений.

Что уже факт, а что пока обещание

Чтобы не потеряться в потоке анонсов, полезно разложить заявления AMD по степени проверенности — от подтверждённого запуска до цифр, которые пока существуют только в презентациях компании.

Аспект Статус Тип подтверждения Что это значит для покупателя
Официальный запуск и начало отгрузок Подтверждено Анонс AMD, публичное мероприятие Реальный шаг вперёд, но не равен массовому внедрению
Именитые партнёры (Anthropic, OpenAI, Meta, Microsoft) Подтверждён интерес Публичные анонсы без данных об объёме Сигнал спроса, не гарантия масштаба закупок
Превосходство над Vera Rubin по FLOPS, памяти, bandwidth Заявлено Внутренние расчёты и модели AMD Требует независимых бенчмарков в реальных задачах
ROCm.ai и автотюнинг (кейс Anthropic) Продемонстрировано Единичный публичный пример Не доказывает зрелость софта для массового переноса CUDA-кода
Открытый стандарт стойки (ORW, UALink) Подтверждено технически Спецификация Open Compute Project Даёт гибкость выбора, но не снимает задачу интеграции у заказчика
Устойчивая продуктивная эксплуатация в масштабе Не подтверждено Независимых данных пока нет Ключевой открытый вопрос всей истории

Из таблицы видно закономерность: чем ближе показатель к "мы это сделали" (запуск, стандарт, отгрузка), тем он проверяем. Чем ближе к "мы обгоняем конкурента" (производительность, экономика), тем сильнее он опирается на собственные расчёты вендора, а не на независимые измерения.

Путь, который Helios ещё должен пройти

Анонс стойки — это только первая точка на длинной траектории между маркетингом и реальной инфраструктурой. Между "AMD показала систему на сцене" и "тысячи компаний гоняют на ней продуктивные модели" лежит несколько этапов, на каждом из которых разрыв между обещанием и реальностью может либо сжаться, либо, наоборот, обнажиться.

flowchart TD
 A["Референсный дизайн и анонс партнёрств"]
 B["Совместная разработка с первыми клиентами"]
 C["Начало серийных отгрузок"]
 D["Сборка систем OEM/ODM-партнёрами"]
 E["Появление в облаке (Azure и другие)"]
 F["Продуктивные нагрузки и независимые бенчмарки"]
 A --> B --> C --> D --> E --> F

Разрыв чаще всего образуется между этапами D и F: производители могут собрать корректные системы по чертежу, но именно на стадии реальной эксплуатации всплывают проблемы прошивок, кабельных соединений, охлаждения и совместимости софта, о которых вендор в презентации никогда не расскажет заранее. Появление Helios в Azure — важный сигнал, что как минимум один крупный оператор готов проверить систему на своей нагрузке, но это не равнозначно широкой публичной доступности для любого клиента без ограничений и региональных оговорок.

Софтовый вопрос: жив ли ещё CUDA-ров

Здесь стоит остудить один из самых соблазнительных выводов. CUDA больше двадцати лет была главным программным слоем вокруг GPU Nvidia — она копилась библиотеками, документацией и, что важнее всего, инженерами, которые умеют с ней работать. Это и есть настоящий "ров": не код сам по себе, а накопленная человеческая компетенция и привычка индустрии.

ROCm.ai с инструментом автопортирования кода снижает высоту этого рва, но не убирает его. Перенос кода — это не то же самое, что перенос знаний, отладочных практик и многолетнего опыта эксплуатации. Открытая архитектура даёт покупателю рычаг — возможность выбирать поставщиков сети, охлаждения и компонентов, не завязываясь на одну экосистему целиком. Но рычаг — это не автоматическое преимущество в цене или простоте: ответственность за интеграцию и тестирование при открытой модели просто перемещается с плеч одного вендора на плечи покупателя и его партнёров.

Что покажут ближайшие кварталы

Реальная проверка Helios начнётся не в момент пресс-релиза, а тогда, когда независимые операторы опубликуют данные о производительности на конкретных моделях, а не о пиковых теоретических цифрах. Стоит следить за тремя вещами: появятся ли измерения производительности на реальных нагрузках, а не только на модельных расчётах AMD; расширится ли присутствие Helios в облаках за пределы точечных пилотов; и будет ли зрелость ROCm подтверждаться массовыми, а не единичными кейсами переноса CUDA-кода.

Главный вывод из запуска Helios не в том, что AMD выпустила мощную стойку — с этим трудно спорить. Он в том, что компания впервые за долгое время бросает вызов не отдельной характеристике Nvidia, а самой модели превращения кремния в надёжный, эксплуатируемый продукт. Ответ на вопрос, получилось ли это, индустрия узнает не из презентации, а из отчётов тех, кто будет эксплуатировать эти стойки в производстве месяцами, а не демонстрировать их на сцене.

Источники

  1. AMD Instinct™ MI400 Series GPUs
  2. AMD’s Helios rack is finally shipping, and it’s coming for Nvidia’s AI dominance
Поделиться:
Telegram Facebook X VK
Scroll to Top