Каже

Вівторок, 29 Вересень 2026

Пошук
Anthropic представила Claude Sonnet 5.5: друга сходинка в індексі інтелекту, але програш за ефективністю
Claude Sonnet 5.5 випередила GPT-6 Astra в терміналі, але програла GPT-6 Sol за ефективністю

Технології

Anthropic представила Claude Sonnet 5.5: друга сходинка в індексі інтелекту, але програш за ефективністю

Anthropic випустила Claude Sonnet 5.5, яка посіла друге місце в Intelligence Index від Artificial Analysis, поступившись лише Opus 5.5. Модель випереджає GPT-6 Astra у Terminal-Bench 4.0, але поступається GPT-6 Sol за співвідношенням інтелекту та витрат.

Anthropic офіційно представила Claude Sonnet 5.5 — нову модель штучного інтелекту, яка вже посіла друге місце в індексі інтелекту Artificial Analysis, поступившись лише власній Opus 5.5. Проте за вартістю виконання завдань новинка поступається конкурентам від OpenAI, зокрема GPT-6 Sol. Про це повідомляє Highload.tech.

У режимі max Claude Sonnet 5.5 додала 18 балів порівняно з Sonnet 5 і піднялася на другу сходинку в Intelligence Index. Попереду лише Opus 5.5 (max). Тарифи залишилися незмінними: кеш-вхід — $0,2 за мільйон токенів, звичайний вхід — $2, вихід — $10. Однак модель генерує більше вихідних токенів на завдання, тому середня вартість одного завдання зросла до $7,60, що приблизно на 50% більше, ніж у Sonnet 5.

Найпереконливіше Sonnet 5.5 виглядає в агентних завданнях. У Terminal-Bench 4.0 вона набирає 64%, тоді як Opus 5.5 і GPT-6 Astra (xhigh) мають по 60%. Для порівняння: Sonnet 5 (max) відстає від нової моделі на 50 пунктів. У Terminal-Bench-Science, який перевіряє автономну роботу в терміналі над реалістичними науковими задачами, результат становить 53%. Попереду лише GPT-6 Astra та Opus 5.5. Цей тест поки що не входить до індексу інтелекту.

В офісній та автоматизаційній роботі Sonnet 5.5 практично зрівнялася з Opus 5.5. У тесті AA-Briefcase (Elo) вона отримала 1811 балів проти 1822 в Opus 5.5. У GDPval-AA (Elo) — 1844 проти 1846. В AutomationBench-AA — 71% проти 70%. Для Opus 5.5 і Astra у Terminal-Bench-Science джерело не називає точних значень, лише вказує, що ці моделі попереду.

Головне застереження: паритет з Opus 5.5 Sonnet 5.5 отримує за значно більшого обсягу токенів. У режимі max, де результат наближається до рівня Opus 5.5, модель витрачає близько 193 тис. вихідних токенів на завдання індексу. Це найбільше споживання серед усіх моделей, які тестувала Artificial Analysis. Порівняно з Sonnet 5 (max) витрати зросли приблизно на 60%, з Opus 5.5 (max) — також на 60%, а з GPT-6 Astra (max) — приблизно в 7 разів. Тобто Astra досягає порівнянного рівня в агентних задачах, витрачаючи в рази менше токенів.

Тарифи Sonnet 5.5 збігаються з тарифами GPT-6 Sol: $2 за мільйон вхідних і $10 за мільйон вихідних токенів. Але за цієї умови модель Anthropic не потрапляє на парето-фронт співвідношення «інтелект — вартість завдання». У високих режимах зусиль Sonnet 5.5 програє Opus 5.5. У нижчих режимах аналогічну якість дають конфігурації GPT-6 Astra або Sol, і обходяться вони дешевше. Найвигідніший варіант — режим high: за інтелектом він ледь відстає від GPT-6 Sol, а вартість завдання практично така сама. За критерієм «інтелект проти токенів» режими low, medium і high у Sonnet 5.5 поступаються режимам high, xhigh і max у GPT-6 Sol. Sol дає вищу продуктивність за меншої кількості вихідних токенів.

Отже, використовувати Sonnet 5.5 у стандартних задачах з огляду на ціну й ефективність не завжди доцільно. Її сильна сторона — агентні сценарії, де модель справді дорівнює флагманам.

Через менший розмір Sonnet 5.5 слабша за Opus у фактичних знаннях та науковому мисленні. У тесті AA-Omniscience точність фактів становить 54% проти 66% в Opus 5.5. Зате частка галюцинацій у Sonnet нижча: 47% проти 59%. На Humanity’s Last Exam і SciCode модель відстає від Opus приблизно на 6 балів.

Технічні характеристики: контекстне вікно — 1 млн токенів, підтримуються текст і зображення, як і в Sonnet 5. Тарифи: $2 / $10 за мільйон вхідних і вихідних токенів, запис у кеш — $2,5, читання з кешу — $0,2. Режимів зусиль п’ять: low, medium, high, xhigh, max. Усі п’ять пройшли через індекс інтелекту з увімкненим резервним переходом за замовчуванням. Приблизно в 0,1% завдань індексу, здебільшого в Terminal-Bench 4.0, модель переходила на Sonnet 5.

Для тестів була використана пре-релізна версія Sonnet 5.5. Anthropic виявила в ній помилку, через яку відповіді на запити зі структурованим виводом можуть погіршуватися. У публічній версії її виправили. За очікуванням компанії, результати майже не зміняться або виявляться трохи заниженими.

4Перегляди

Тетяна Климчук

Автор

Журналістка

Тетяна Климчук працює з темами суспільства, політики, економіки та щоденних новин. У редакції Каже відповідає за перевірку фактів, контекст і зрозуміле пояснення подій для читачів.