Новая стратегия в AI-инфраструктуре
AMD и Cerebras Systems объявили о стратегическом техническом партнерстве, направленном на изменение парадигмы AI-инференса. На мероприятии Advancing AI 2026 компании представили решение, основанное на принципе «дезагрегированного инференса», предназначенное для разделения двух основных этапов генерации ответов ИИ. Интегрируя системы AMD Helios с технологией Cerebras Wafer-Scale Engine (WSE), компании стремятся решить проблему баланса между высокой пропускной способностью и необходимостью сверхнизкой задержки.
Механика дезагрегированного инференса
Традиционно ИИ-оборудование выполняло как обработку запросов, так и генерацию ответов, что создавало нагрузку на одни и те же ресурсы памяти и вычислений. В рамках новой архитектуры рабочая нагрузка распределяется:
- AMD Helios берет на себя высокопроизводительную обработку запросов и работу с большими контекстными окнами.
- Cerebras Wafer-Scale Engine обеспечивает декодирование и генерацию токенов с минимальными задержками.
Такое разделение труда позволяет оптимизировать оба этапа процесса. Согласно внутреннему моделированию AMD и Cerebras, это решение способно обеспечить до 5 раз более высокую производительность (токенов в секунду на ватт) по сравнению с использованием только систем Cerebras WSE.
Рыночные последствия и внедрение
Это партнерство является прямым вызовом текущим стандартам индустрии, где доминирует Nvidia. Фокусируясь на сегменте «ультранизких задержек», AMD позиционирует технологию Helios как фундамент для сбалансированных нагрузок в дата-центрах, в то время как Cerebras обеспечивает скорость, необходимую для робототехники и автономных агентов. Cerebras планирует развернуть системы AMD Helios в своих центрах обработки данных, с доступностью через Cerebras Cloud во второй половине 2026 года. Это подчеркивает переход отрасли к гетерогенным инфраструктурам, где аппаратное обеспечение подбирается под конкретные рабочие задачи.

