Новый уровень скорости для ИИ-решений
Компания OpenAI анонсировала запуск режима «Ultrafast», предназначенного для радикального ускорения работы своей самой мощной модели GPT-5.6 Sol. Благодаря партнерству с разработчиком чипов Cerebras, новая технология позволяет достичь скорости генерации до 750 токенов в секунду, что в 14 раз быстрее стандартных показателей. Это решение призвано устранить компромисс между вычислительной мощностью модели и скоростью отклика, критически важной для бизнес-приложений.
Технологический прорыв
Основная проблема при работе с большими языковыми моделями заключается в ограничениях пропускной способности памяти традиционных GPU, требующих постоянной передачи весов модели между чипом и внешним хранилищем. Cerebras решила эту задачу, разместив 44 ГБ памяти SRAM непосредственно на своих чипах «wafer-scale». Это позволяет удерживать веса внутри системы, обеспечивая бесперебойную работу модели.
В ходе сравнительных испытаний с использованием сложного теста «Humanity’s Last Exam» (HLE), состоящего из 2500 специализированных вопросов, GPT-5.6 Sol в режиме Ultrafast справилась с задачей за 11 часов и 11 минут, тогда как модели-конкуренты потребовалось более 78 часов.
Сферы применения
Высокая скорость обработки данных открывает новые возможности для корпоративного сектора:
- Кибербезопасность: мгновенное обнаружение и нейтрализация угроз в условиях атак.
- Финансовые рынки: оперативный анализ данных в реальном времени.
- Клиентская поддержка: использование интеллектуальных агентов для мгновенного решения запросов.
- Работа с документацией: ускоренное составление сложных юридических и инженерных отчетов.
На данный момент режим Ultrafast доступен в рамках ограниченного предварительного просмотра через API OpenAI. По мере масштабирования инфраструктуры доступ к сервису будет открыт для более широкого круга корпоративных клиентов.

