Переход к специализированному кремнию
На конференции Hot Chips 2026 компания OpenAI представила свой первый специализированный ASIC для вывода ИИ (inference), получивший кодовое название Jalapeño. Разработанный совместно с Broadcom, этот чип знаменует собой стратегический отход от исключительного использования кластеров GPU общего назначения, подчеркивая стремление компании оптимизировать инфраструктуру под низкие задержки и высокие требования современных агентных ИИ-систем.
Ведущие инженеры OpenAI Ричард Хо, Рави Нараянасвами и Крис Лири представили детали девятимесячного цикла разработки: от проектирования RTL в конце 2024 года до запуска в производство в конце 2025-го. Проект активно использовал внутренние ИИ-инструменты для ускорения физического проектирования. Чип, изготовленный по 3-нм техпроцессу TSMC, архитектурно оптимизирован для работы с тремя стадиями LLM-запроса: префилл, генерация черновика и верификация.
Производительность и эффективность
OpenAI сопоставила показатели Jalapeño с системами NVIDIA GB200 и GB300. Используя бенчмарк InferenceX, компания заявила о значительно более высокой эффективности «смешанных токенов в секунду на киловатт». На модели DeepSeek R1 670B чип показал примерно 1,7-кратное преимущество по пропускной способности на киловатт и 3,6-кратное снижение задержки по сравнению с GB300 при энергопотреблении 700 Вт против 1400 Вт у конкурента.
Архитектура включает 216 ГБ памяти HBM4 (по сообщениям, от Samsung) с пропускной способностью 15,4 ТБ/с. За счет локального хранения кэша KV внутри чипа и отключения неиспользуемых вычислительных блоков OpenAI удалось минимизировать потери энергии, свойственные гетерогенным GPU-системам, где простаивающие ускорители продолжают потреблять значительную базовую мощность.
Стратегическое значение
Выпуск Jalapeño подчеркивает тренд на вертикальную интеграцию аппаратного стека среди лидеров ИИ-индустрии. Контролируя как «железо», так и программную платформу (фреймворк Gluon), OpenAI стремится обойти ограничения CUDA. Это позволяет компании самостоятельно управлять распределением и планированием рабочих нагрузок. Тем не менее, чип предназначен исключительно для инференса, а не для обучения моделей, где позиции NVIDIA остаются доминирующими. Учитывая планы по выпуску второго и третьего поколений, OpenAI демонстрирует долгосрочную ставку на проприетарное «железо» для обеспечения экономической эффективности своих сервисов.

