Автономность и самокоррекция как ключевые отличия
Основной акцент в релизе Anthropic сделан на способности Opus 5 самостоятельно проверять собственную работу и доводить сложные задачи до результата без постоянного контроля. Теперь, когда Claude пишет код, он также выступает в роли инструмента, который проверяет ошибки на уровне логики, а не только синтаксиса. Это снижает необходимость в постоянных уточнениях со стороны пользователя. Habr
В качестве примера компания приводит тест, где модели нужно было воссоздать трехмерный чертеж детали без прямого доступа к изображению. Opus 5 самостоятельно написала алгоритм компьютерного зрения для извлечения геометрии из пикселей и успешно справилась с задачей, в отличие от конкурентов. Эта способность к проактивному решению проблем является главным отличием новой версии. Tut-news
Сравнение производительности и тесты
Несмотря на фокус на автономности, Opus 5 демонстрирует значительный рост в стандартных тестах. По заявлению разработчиков, модель по качеству приближается к более мощной Fable 5, но стоит вдвое дешевле. Улучшения подтверждаются показателями из внутренних и партнерских тестов.
Ключевые результаты производительности:
- Frontier-Bench v0.1 (программная инженерия): результат более чем в два раза превосходит Opus 4.8 при меньшей стоимости выполнения задачи.
- ARC-AGI 3 (решение незнакомых задач): показатель втрое выше, чем у ближайшего конкурента.
- Zapier AutomationBench (автоматизация бизнес-процессов): доля успешных решений в 1,5 раза выше по сравнению со следующей моделью.
Заметный прогресс отмечен и в научных дисциплинах, особенно в органической химии, где результат вырос на 10,2 процентного пункта по сравнению с Opus 4.8.
Стоимость и доступность
Anthropic сохранила стоимость новой модели на уровне предыдущей версии. Цена составляет $5 за 1 млн входных токенов и $25 за 1 млн выходных токенов. Таким образом, пользователи получают более производительный инструмент без увеличения затрат. Компания подчеркивает, что оценивать модель следует по стоимости полного решения задачи, которая снижается за счет меньшего количества итераций.
Модель уже интегрирована в продукты компании и доступна по нескольким каналам:
- Claude API: по идентификатору `claude-opus-5`.
- Веб-интерфейс claude.ai: стала моделью по умолчанию для тарифа Max и самой мощной опцией на тарифе Pro.
- Облачные платформы: развернута на Amazon Bedrock, Google Cloud и Microsoft Foundry.
Безопасность и функции для разработчиков
Одновременно с ростом возможностей Anthropic внедрила дополнительные меры безопасности. Согласно внутренним аудитам, Opus 5 точнее следует инструкциям и реже склонна к обманному поведению. При этом ее возможности в технологиях двойного назначения, например, в наступательной кибербезопасности, не были усилены.
Для разработчиков появились новые функции, такие как «режим мышления», включенный по умолчанию, и параметр `effort` для управления глубиной проработки ответа. Запросы, связанные с кибербезопасностью, могут автоматически перенаправляться на менее мощную модель Opus 4.8, чтобы минимизировать риски.
Частые вопросы
Сколько стоит использование Claude Opus 5?
Стоимость Claude Opus 5 осталась на уровне предыдущей версии Opus 4.8 и составляет $5 за миллион входных токенов и $25 за миллион выходных токенов. Пользователи API также могут подключить ускоренный режим Fast mode по цене $10 за вход и $50 за вывод. Для подписчиков тарифа Claude Max модель стала вариантом по умолчанию, а на Claude Pro доступна как самая мощная опция.
Как Claude Opus 5 самостоятельно проверяет текст и код на ошибки?
Новая модель получила встроенный механизм рассуждений и самопроверки, действующий по принципу анализа до выдачи ответа. Opus 5 автоматически находит первопричины багов, исправляет логические ошибки в коде и проверяет тексты. В тестах модель даже смогла создать алгоритм компьютерного зрения для воссоздания 3D-чертежа из пикселей без прямого просмотра изображения.
Какие ограничения безопасности действуют в Claude Opus 5?
Anthropic усилила протоколы безопасности, сделав Opus 5 менее восприимчивой к обходным манёврам и обману. Модель намеренно ограничена в задачах наступательной кибербезопасности, таких как разработка эксплойтов, бинарное сканирование и тестирование на проникновение. Потенциально опасные запросы в этой сфере автоматически перенаправляются на менее мощную модель Opus 4.8.