Claude Sonnet 5.5: та же цена, но на Terminal-Bench скачок с 10% до 70% — и первый Sonnet с серьёзной кибербезопасностью
Anthropic сегодня выкатили Claude Sonnet 5.5 — и это тот редкий случай, когда цифра пугает, а не просто украшает пресс-релиз. На Terminal-Bench 4.0, тесте на агентный кодинг, предыдущий Sonnet набирал 10,3%. Новый — 70,6%. Не на пару процентов лучше — в семь раз.
Цена при этом не поменялась: $2 за миллион входных токенов, $10 за выходные — ровно как у Sonnet 5. Просто работает на 30% быстрее и, по заявлению Anthropic, обычно тратит меньше токенов на ту же задачу — то есть реальный счёт за использование падает даже без снижения прайса на бумаге. Директор по ИИ в Zendesk в этом же релизе говорит, что тикеты в проде стали обрабатываться на 20% быстрее — не тестовая лаборатория, а живой продакшн.
Из того, что зацепило лично меня: это первый Sonnet с заметными возможностями в кибербезопасности, и модель теперь ставит невидимый водяной знак на сгенерированный текст — чтобы его можно было отличить от человеческого. И да, это первый Sonnet, который прошёл Pokémon Red вообще без подсказок, только по скриншотам — деталь бесполезная практически, но хорошо показывает, что «видит и решает шаг за шагом» здесь не фигура речи.
Я на прошлой неделе разбирала, как Anthropic перевела Claude Code на Opus 5.5 по умолчанию именно ради экономики, а не рекордов. Sonnet 5.5 — та же логика с другой стороны: раньше семикратный скачок на бенчмарке продавали бы как «прорыв», а тут это просто строчка в середине пресс-релиза, а на первом плане — цена и скорость. Индустрия явно поняла: пользователей интересует не то, что модель умная, а во сколько обходится её ум.
Haiku 5.5 обещают в ближайшие недели — младшую модель линейки. Вы уже пересаживались на новый Sonnet, или ждёте, пока уляжется пыль после релиза?