
Содержание4 разделов
Коротко
- Opus 5.5 открывает семейство Claude 5.5 и становится основной моделью Anthropic для массовых задач.
- Входные токены подешевели с $5 до $4 за миллион, выходные с $25 до $20.
- С учётом экономии токенов задача в среднем обходится на 40% дешевле, чем на Opus 5.
- Сильнее всего модель выросла в долгих задачах, где нужно самой планировать шаги.
22 сентября Anthropic анонсировала Claude Opus 5.5. Компания делает ставку на длинную работу: модель должна сама разбивать задачу на шаги, вызывать инструменты, проверять промежуточный результат и вносить правки в большой проект, пока человек занят другим.
Что Claude Opus 5.5 умеет делать без присмотра на реальных задачах
Самые наглядные цифры Anthropic взяла у ранних пользователей. Один из них перенёс на новую платформу кодовую базу в 680 тысяч строк меньше чем за сутки. По его собственной оценке, команда инженеров возилась бы с этим несколько недель.
В другом случае модель провела аудит проекта на 200 тысяч строк и исправила найденное за неполные три часа. У прошлой Opus 5 та же работа заняла свыше 20 часов, а токенов ушло в 2,5 раза больше. Ещё один тест: перевод балансировщика HAProxy с языка C на Rust. Opus 5.5 закончила за 9,5 часа, более дорогая Fable 5.1 за 12, и вышло на 51% дешевле.
По бенчмаркам картина такая. В Terminal-Bench 4.0, где агент решает многошаговые задачи в командной строке, у Opus 5.5 66,4%, и это выше Opus 5, Fable 5.1, GPT-6 Astra и GPT-5.6 Sol. В FrontierCode v1.1 модель набрала 54,4% против 50,3% у Fable 5.1 и 53,3% у GPT-6 Astra. В GDPval-AA v2.1, который имитирует рабочие задачи 44 профессий, получилось 1846 очков против 1735 у Fable.
Что нам понравилось в анонсе: Anthropic сама признаёт, что у флагманов разница в бенчмарках плохо отражает реальную. По её оценке, на практике Opus 5.5 и Fable 5.1 ближе друг к другу, чем выглядит в таблице. Редкий случай, когда компания сама охлаждает восторги.
Как Claude Opus 5.5 справляется с отчётами, где нельзя ошибиться
Самый интересный тест связан с финансовой аналитикой. Модели поручили подготовить отчёт о результатах компании, а нужный пресс-релиз спрятали в специально собранной копии интернета. Условие было жёсткое: неверная цифра или неточная цитата, и тест провален. Opus 5.5 прошла порог в 16 попытках из 18. Fable 5.1 и Opus 5 не справились ни разу.
Для тех, кто готовит с помощью ИИ документы, это важнее любых процентов в тестах на код. Главная претензия к нейросетям в офисе как раз в том, что они уверенно подставляют правдоподобные, но выдуманные цифры. Почему так происходит, мы объясняли в разборе про галлюцинации.
Сколько стоит Claude Opus 5.5 в API
| За 1 млн токенов | Opus 5 | Opus 5.5 |
|---|---|---|
| Вход | $5 | $4 |
| Выход | $25 | $20 |
| Чтение из кэша | $0,50 | $0,20 |
| Запись в кэш | $6,25 | $5 |
Для Claude Code и Claude Platform есть ускоренный режим Fast Mode, до 2,5 раза быстрее обычного. Стоит он дороже, $8 и $40 за миллион токенов на входе и выходе. Обычная генерация тоже ускорилась, больше чем на 30%. Если цифры про токены пока не складываются в голове, загляните в наш разбор про токены и контекст.
Почему ответы Claude Opus 5.5 стали понятнее
Anthropic переработала и манеру ответа. Главное модель должна выносить наверх, текст структурировать лучше, а жаргона и странных оборотов использовать меньше. Звучит как мелочь, но при долгой совместной работе от стиля ответа зависит, захочется ли вообще открывать чат на следующий день.
Через полтора часа после анонса OpenAI показала обновлённые GPT-6 Sol и Luna, так что сравнений будет много. Если независимые тесты разойдутся с заявленными цифрами, мы расскажем.
Вы уже доверяете нейросети задачи, которые идут несколько часов без вашего участия, или пока проверяете каждый шаг?
Источники

Как вам материал?



Комментарии