Claude Sonnet 5: агентный флагман среднего класса

01.07.2026
Claude Sonnet 5: агентный флагман среднего класса

30 июня 2026 года Anthropic выпустила Claude Sonnet 5 — новую модель среднего («midsize») класса, которую компания называет самой агентной версией Sonnet за всю историю линейки. Модель уже стала дефолтной для Free и Pro тарифов, а также доступна пользователям Max, Team и Enterprise, в Claude Code и через Claude API под именем claude-sonnet-5.

Что изменилось по сути

Главный тезис релиза — Sonnet 5 максимально сблизился по агентным способностям с топовой моделью Opus 4.8, при этом оставаясь заметно дешевле. Модель умеет самостоятельно строить планы, пользоваться браузером и терминалом, и вести автономную работу на уровне, который ещё несколько месяцев назад требовал более крупных и дорогих моделей. Ранние тестировщики отмечают, что модель доводит сложные многоэтапные задачи до конца там, где предыдущие версии Sonnet останавливались на середине, и проверяет собственный вывод без явного запроса.

Benchmarks: цифры против Sonnet 4.6 и Opus 4.8

По опубликованным Anthropic данным, Sonnet 5 превосходит предшественника Sonnet 4.6 по всем протестированным категориям и заметно сокращает разрыв с Opus 4.8.

БенчмаркSonnet 4.6Sonnet 5Opus 4.8
SWE-bench Pro (агентный код)58.1%63.2%69.2%
OSWorld-Verified (компьютерное использование)78.5%81.2%
Terminal-Bench 2.167.0%80.4%
Humanity’s Last Exam (с инструментами)46.8%57.4%57.9%
GDPval-AA v2 (интеллектуальная работа)16181615

Любопытно, что на бенчмарке GDPval-AA v2, оценивающем работу со знаниями, Sonnet 5 даже обходит Opus 4.8. Anthropic предоставляет несколько уровней «effort» (low, medium, high, xhigh) — чем выше уровень, тем больше токенов тратится на рассуждение, что повышает и качество, и стоимость.

Цены и доступность

На старте модель предлагается по вводной цене $2 за миллион входных токенов и $10 за миллион выходных — до 31 августа 2026 года, после чего цена вырастет до $3/$15 за миллион. Для сравнения, Opus 4.8 стоит $5/$25 за миллион токенов, так что Sonnet 5 остаётся ощутимо дешевле при близком качестве на низком и среднем уровне effort. Важный технический момент: модель использует обновлённый токенизатор (как в Opus 4.7), из-за чего один и тот же текст может занимать в 1.0–1.35 раза больше токенов, чем раньше — но вводная цена подобрана так, чтобы переход был примерно cost-neutral.

Кому пригодится модель

Партнёры раннего доступа делятся конкретными кейсами — от разработки до бизнес-автоматизации:

  • Zapier поручил модели двухэтапную задачу (обновить тиры аккаунтов в Salesforce и разослать письмо enterprise-клиентам) — Sonnet 5 довёл её до конца самостоятельно.
  • Lovable отмечает, что модель делает больше за меньшее число шагов и корректно отказывается от небезопасных запросов.
  • Разработчики использовали модель на десятках реальных pull request’ов — она доводила изменения до протестированного и верифицированного результата без участия инженера.
  • Один тестировщик описал, как модель без явной просьбы написала воспроизводящий тест, реализовала фикс, а затем откатила его, чтобы подтвердить, что баг действительно исправлен.
  • ClickHouse использует модель для агентов, исследующих live-данные — за счёт более компактных цепочек рассуждений время до получения инсайта заметно сократилось.

Безопасность и киберриски — важно для практиков

Отдельный блок в релизе посвящён кибербезопасности, что особенно релевантно для специалистов по пентесту и bug bounty. Anthropic специально не обучала Sonnet 5 на кибербезопасных задачах — модель показывает существенно более слабые результаты в разработке эксплойтов по сравнению с Opus 4.8 и Mythos 5, и ни в одном тесте не смогла создать полноценный рабочий эксплойт для уязвимостей Firefox. При этом модель показала немного более высокий процент частичных успехов по сравнению с Sonnet 4.6 — это объясняется скорее общим ростом интеллекта модели, а не целевым обучением. Из-за этого модель запускается с включёнными по умолчанию cyber safeguards — теми же, что применяются в Opus 4.7 и 4.8, хотя и менее строгими, чем у Fable 5. Anthropic прямо рекомендует использовать Opus 4.8 для легитимной кибербезопасной работы, требующей сниженных ограничений (в рамках Cyber Verification Program).

На общих проверках безопасности Sonnet 5 показал более низкий уровень нежелательного поведения по сравнению с Sonnet 4.6, лучше отражает попытки prompt injection и реже проявляет галлюцинации и sycophancy.

Реакция сообщества

Реакция разработчиков смешанная: часть хвалит соотношение цена/качество и контекстное окно на 1M токенов, часть указывает, что после окончания вводного периода ценообразование выглядит менее выгодным на фоне Opus 4.8 и открытых моделей вроде GLM-5.2. Практическая рекомендация, которую выводят аналитики: основной поток агентного кодинга, работы с инструментами и knowledge work стоит направлять на Sonnet 5, а Opus 4.8 резервировать для критичных по точности задач.