Sonnet 5.5 от Anthropic приближается к Opus на фоне осенней гонки ИИ-моделей

Популярные

Minimalist line art illustration of a human profile with a connected neural network node symbol

Быстрое чтение

  • Anthropic выпустила Claude Sonnet 5.5 28 сентября вслед за сентябрьским дебютом Opus 5.5.
  • По данным Artificial Analysis, Sonnet 5.5 получила 56 баллов в Intelligence Index, немного уступив Opus 5.5 с 58 баллами.
  • Тарифы на входные и выходные токены Sonnet 5.5 установлены на уровне половины цен тира Opus 5.5.
  • Предварительные результаты кодирования показывают, что Sonnet 5.5 превосходит ряд конкурентов в тесте Terminal-Bench 4.0.
Компания Anthropic представила Claude Sonnet 5.5, приблизив возможности своей модели средного уровня к флагманским характеристикам предыдущего поколения при сниженной стоимости токенов, сообщает The Rundown. Релиз от 28 сентября следует за развертыванием Claude Opus 5.5 22 сентября, что усиливает конкурентное давление в секторе искусственного интеллекта по мере того, как разработчики оценивают соотношение затрат, скорости и глубины рассуждений.

В режиме максимальной производительности Artificial Analysis присвоила Sonnet 5.5 оценку 56 по своему индексу Intelligence Index, уступив лишь Opus 5.5 с показателем 58. Модель среднего уровня почти сравнялась с Opus в офисных тестовых нагрузках, таких как GDPval-AA и AA-Briefcase, а также набрала 71% против 70% у Opus в AutomationBench-AA. В кодировочном тесте Terminal-Bench 4.0 аналитики зафиксировали 64% для Sonnet, опередив как Opus, так и GPT-6 Astra, набравших около 60%. Эти показатели остаются предварительными, поскольку тестировщики отметили ошибку структурированного вывода в предрелизном развертывании и запланировали повторные тесты.

Стоимость, скорость и операционные компромиссы

Anthropic заявляет, что Sonnet 5.5 генерирует вывод по меньшей мере на 30% быстрее, чем Sonnet 5, а затраты на задачи снижены на величину до 30%. Тарифы на входные и выходные токены для Sonnet 5.5 составляют половину расценок Opus 5.5, который в свою очередь вышел со снижением цен на входные и выходные токены на 20%. Тем не менее, реальные расходы зависят от объема токенов, потребляемых моделью. Artificial Analysis оценила задачи с максимальным уровнем усилий примерно в $7.60, что примерно на 50% дороже, чем Sonnet 5, показывая, что максимальные усилия по рассуждению увеличивают нагрузку на токены.

Обширное тестирование, проведенное The New Stack при сравнении Opus 5.5 и конкурирующей Fable 5.1, подчеркивает нюансы компромиссов между глубиной рассуждений и сокращением путей выполнения. В то время как модели Opus преуспевают в сложных многошаговых задачах, их склонность к чрезмерному обдумыванию может увеличивать объем токенов и время работы. С другой стороны, более быстрые модели рискуют обходить критические интеграционные проверки. Sonnet 5.5 внедряет новые средства киберзащиты, способные перенаправлять запросы высокого риска обратно на Sonnet 5, что требует от инженерных команд проверки влияния таких резервных маршрутов на поведение приложений.

Стратегический тайминг накануне отраслевых событий

Двойные сентябрьские релизы Anthropic совпали по времени с подготовкой компании OpenAI к открытию конференции DevDay. В условиях меняющейся ценовой структуры и сокращения разрыва в производительности между моделями инженерным командам приходится тщательно взвешивать показатели успешного завершения задач, тарифицируемые токены, задержки и требования к человеческой проверке. По мере того как поставщики бенчмарков завершают запланированные повторные тесты, разработчики должны продолжать сопоставлять модели с конкретными производственными рабочими нагрузками, а не полагаться исключительно на статические маркетинговые оценки.

|
Редакционный вклад:Редакция Azat TV
|
Издатель:Azat TV

Самые последние