Към съдържанието
Claude Opus 5 и резултатите му от бенчмарковете на Anthropic срещу Fable 5 и GPT-5.6 Sol
Категория: AI Новини

Claude Opus 5: новият лидер сред AI моделите? [2026]

Claude Opus 5 излезе на 24 юли 2026 с 43,3% при агентно кодиране и 30,2% при ARC-AGI-3, на половин цена спрямо Fable 5. Ето къде води и къде все пак губи

ИД
Иван Драганов//11 мин.
𝕏FBLI

Накратко: Claude Opus 5 е новият модел на Anthropic, пуснат на 24 юли 2026 година. Компанията го описва като модел, който се доближава до най-силния ѝ модел Fable 5, но струва наполовина. По собствената таблица на Anthropic Opus 5 води при повечето показатели — и все пак губи при няколко от тях.

Ключови факти:


Какво представи Anthropic с Claude Opus 5?

Claude Opus 5 е нов модел за агентно кодиране и работа с документи, обявен на 24 юли 2026 година. Агентен модел означава такъв, който сам планира стъпките, ползва инструменти като терминал и браузър и работи по задачата, докато я завърши, вместо да отговаря еднократно.

Anthropic пусна новината като седем публикации в профила @claudeai — общо осем диаграми и едно кратко видео. Формулировката в първата е пестелива: моделът се доближавал до Fable 5 „на половин цена".

Съобщението идва два месеца след Opus 4.8, който излезе на 28 май 2026 година според TechCrunch. Темпото на смяна на моделите вече се мери в седмици, не в години.

Claude Opus 5 срещу Fable 5, Opus 4.8 и GPT-5.6 Sol — първата част от таблицата с резултати
Първата част от официалната таблица на Anthropic. Източник: @claudeai в X

Защо новината е важна точно сега?

Цената за задача стана по-важна от върха на класацията. През последната година разликата между първия и третия модел при повечето тестове е няколко процентни пункта, а разликата в сметката е двойна или тройна.

Anthropic залага точно на това. Opus 5 не е най-скъпият модел на компанията и не е представен като такъв — представен е като най-разумният за ежедневна работа.

За екипите, които вече плащат за агенти, това е по-съществено от още един рекорд. Кой е на върха, се сменя често. Кой върши същата работа за половин пари — това се усеща в бюджета всеки месец.

Какви резултати показва Opus 5 при бенчмарковете?

Claude Opus 5 показва най-високия резултат при седем от дванадесетте реда в таблицата, която Anthropic публикува. При още два е практически изравнен, а при три отстъпва. Ето кои числа се открояват.

При агентното кодиране в терминал (Frontier-Bench v0.1) моделът стига 43,3% срещу 33,7% за Fable 5, 34,4% за GPT-5.6 Sol и 21,1% за Opus 4.8. Това е удвояване спрямо предишния Opus за два месеца.

При работата с компютър (OSWorld 2.0) резултатът е 70,6% срещу 66,1% за Fable 5. При бизнес процесите (AutomationBench) разликата е още по-голяма — 26,0% срещу 17,4%.

Най-обсъжданото число е друго. При ARC-AGI-3 — тест за решаване на непознати задачи — Opus 5 постига 30,2%, при 1,5% за Opus 4.8 и 7,8% за GPT-5.6 Sol.

Резултатът на Claude Opus 5 при ARC-AGI-3 спрямо разхода за оценка в долари
ARC-AGI-3: 30,2% за Opus 5 срещу 7,8% за GPT-5.6 Sol. Източник: @claudeai в X

ARC-AGI-3 е поредица от 135 среди, в които моделът трябва да разбере непознат интерфейс само от обратната връзка, която получава. Тестът се води от ARC Prize Foundation и е направен така, че наизустените данни да не помагат.

„Всяка среда е построена без културните знания, на които моделът обикновено би се опрял. Така средите изолират абстрактното разсъждение." — Грег Камрад, президент на ARC Prize Foundation

Едно уточнение по числата. Anthropic описва предимството си като „три пъти" пред следващия модел, но по данните в самата таблица съотношението спрямо GPT-5.6 Sol е около 3,9 пъти. Разликата е в полза на Opus 5, а по-предпазливата формулировка е на компанията.

Къде Opus 5 губи и кой го изпреварва?

Claude Opus 5 не е пръв навсякъде и Anthropic не го крие — губещите редове са в същата таблица.

При агентното кодиране по DeepSWE v1.1 води GPT-5.6 Sol със 72,7% срещу 68,8%. При FrontierCode v1.1 Fable 5 е напред с една десета от процента — 53,5% срещу 53,4%, тоест на практика равенство.

При правните задачи Fable 5 отново е по-силен (13,3% срещу 11,7%), а при здравните води Mythos 5 с 66,0% срещу 59,8%. Дори GPT-5.6 Sol е малко напред при здравните задачи с 60,5%.

Втората част от таблицата на Anthropic, където Claude Opus 5 губи при част от показателите
Втората част от таблицата — редовете, в които Opus 5 не е пръв. Източник: @claudeai в X

Има и по-важна уговорка. Дребният шрифт под диаграмата за Frontier-Bench казва, че резултатите са от вътрешно пускане на теста, на конкретна тестова обвивка, като при отказ от страна на защитните класификатори за Opus 5 и Fable 5 е ползван Opus 4.8.

Това са числа на производителя. Независима проверка от трета страна още няма — до нея всяка класация е предварителна.

Колко ефективен е Opus 5 спрямо цената за задача?

Claude Opus 5 показва най-ясното си предимство не при върховия резултат, а при съотношението разход-резултат. Anthropic публикува четири диаграми точно за това.

При Frontier-Bench Opus 5 стига около 44% при разход от порядъка на 14 долара за опит, докато Fable 5 остава под 34% дори при над 25 долара за опит. При еднакъв разход разликата е още по-видима.

Claude Opus 5 при агентно кодиране — резултат спрямо разход за опит при различни нива на усилие
Frontier-Bench v0.1: Opus 5 постига повече при по-нисък разход за опит. Източник: @claudeai в X

Същата картина се повтаря при работата с компютър. Opus 5 надминава 60% още при около 9 долара за задача — ниво, до което Fable 5 стига чак около 20 долара.

Работа с компютър при Claude Opus 5 — OSWorld 2.0 спрямо разхода за задача
OSWorld 2.0: кривата на Opus 5 стои над останалите при всеки разход. Източник: @claudeai в X

Ето и една сметка, която всеки може да провери. Екип, който изразходва 50 милиона входни и 10 милиона изходни токена месечно, плаща 500 долара при Opus 5 и 1 000 долара при Fable 5 — разликата е 500 долара всеки месец при близки резултати. За контрол на такива сметки писахме отделно в ръководството за разходите за AI.

По-подреден ли е Opus 5 в поведението си?

Claude Opus 5 получава 2,30 по вътрешната скала на Anthropic за рисково поведение, където по-ниското е по-добро. За сравнение: Opus 4.8 е с 2,85, Mythos 5 с 2,81, а Sonnet 5 с 3,35.

Оценката идва от автоматизиран поведенчески одит, който мери склонността на модела към прибързани или подвеждащи действия и спазването на вътрешните правила на компанията. И тук източникът е самата Anthropic.

Поведенческият одит на Claude Opus 5 срещу Opus 4.8, Mythos 5 и Sonnet 5
Рисково поведение по скала от 1 до 10 — по-ниското е по-добро. Източник: @claudeai в X

Новото е и механизмът за автоматично връщане към Opus 4.8, когато защитните класификатори маркират заявка. Функцията е в бета и цели по-малко откази вместо празен отговор.

Какво може Opus 5 при задачите по киберсигурност?

Claude Opus 5 открива уязвимости в отворен код при 79,4% от предизвикателствата в OSS-Fuzz, срещу 61,5% за Opus 4.8 и 80,0% за Mythos 5. Тук напредъкът спрямо предишния Opus е съществен.

При писането на работещ exploit картината е друга: четири успешни случая за Opus 5 срещу тринадесет за Mythos 5 и нула за Opus 4.8. Anthropic заявява, че класификаторите позволяват търсене на уязвимости в изходен код, но блокират сканиране на двоични файлове, тестове за проникване и генериране на exploit.

Claude Opus 5 при откриване на уязвимости и писане на exploit в отворен код по OSS-Fuzz
OSS-Fuzz: откриване на уязвимости срещу успешна експлоатация. Източник: @claudeai в X

Компанията добавя, че тези класификатори се намесват около 85% по-рядко, отколкото при Fable 5. За екипите по сигурност това означава по-малко излишни откази при законна работа.

Сравнение: Opus 4.8, Opus 5 и Fable 5

плъзни →
Сравнение: Агентно кодиране в терминал, Нови задачи (ARC-AGI-3), Работа с компютър, Бизнес процеси, Агентно кодиране (DeepSWE), Милион входни токена, Милион изходни токена
ПоказателOpus 4.8Opus 5Fable 5GPT-5.6 Sol
Агентно кодиране в терминал21,1%43,3%33,7%34,4%
Нови задачи (ARC-AGI-3)1,5%30,2%7,8%
Работа с компютър55,7%70,6%66,1%62,6%
Бизнес процеси17,0%26,0%17,4%18,1%
Агентно кодиране (DeepSWE)59,0%68,8%69,7%72,7%
Милион входни токена5 долара5 долара10 долара
Милион изходни токена25 долара25 долара50 долара

Таблицата обяснява защо въпросът в заглавието стои с въпросителна. Opus 5 удвоява предшественика си при агентните задачи и стига Fable 5 при половин цена, но не побеждава всички навсякъде.

Предимства
  • Най-висок резултат при седем от дванадесет реда в официалната таблица на Anthropic
  • Същата цена като Opus 4.8 — по 5 и по 25 долара за милион токена
  • Наполовина по-евтин от Fable 5 при близки резултати
  • Контекст от 1 милион токена и до 128 000 изходни токена
  • Най-ниската оценка за рисково поведение сред моделите на Anthropic
×Недостатъци
  • ×Числата са от вътрешни тестове на Anthropic, без независима проверка
  • ×Изостава от GPT-5.6 Sol при DeepSWE v1.1 — 68,8% срещу 72,7%
  • ×Отстъпва на Fable 5 при правни и на Mythos 5 при здравни задачи
  • ×Fast mode се таксува на двойна цена
  • ×Разходът за сложна агентна задача остава висок — около 14 долара за опит

Къде можете да ползвате Opus 5 и при какви условия?

Claude Opus 5 е достъпен от деня на обявяването във всички платени планове и през Claude API, с идентификатор claude-opus-5. Моделът е и на Amazon Bedrock, Google Cloud и Microsoft Foundry.

Моделът е новият основен избор в плана Claude Max и най-силният достъпен в Claude Pro. Fast mode работи около 2,5 пъти по-бързо от стандартния режим и се таксува двойно.

Техническите граници са 1 милион токена контекст и до 128 000 изходни токена, а при пакетната обработка — до 300 000 с бета заглавка. Надеждната граница на знанията е май 2026 година.

Как това засяга България?

Българските екипи усещат тази смяна най-бързо през сметката, не през класацията. Разработчиците тук работят със същите цени на API като всички останали, а месечната разлика от няколкостотин долара е реална за малка фирма.

Има и втора страна. От 2 август 2026 година влизат в сила изисквания по AI Act за прозрачност, които засягат и българските компании, ползващи такива модели в свои продукти.

Практичният извод за екипите у нас: моделът с най-добра стойност за парите се сменя на всеки два месеца, затова кодът си струва да е независим от конкретния доставчик. Кой печели дългосрочно, разгледахме в сравнението между ChatGPT, Claude и Gemini.

Какво следва оттук нататък?

Anthropic още не е обновила най-бързия си модел Haiku, което оставя очевидна следваща стъпка. Fable 5 остава на върха на ценовата листа и запазва предимство при част от специализираните задачи.

Следващата важна дата е независимата проверка. Докато класациите на трети страни не пуснат свои резултати, таблицата остава такава, каквато я е представил производителят.

За читателите, които следят линията Opus, предишната стъпка е описана в прегледа на Opus 4.7.

Често задавани въпроси за Claude Opus 5

Какво е Claude Opus 5?+
Claude Opus 5 е агентен AI модел на Anthropic, пуснат на 24 юли 2026 година, предназначен за сложно кодиране и работа с документи. Идентификаторът му в API е claude-opus-5.
Колко струва Claude Opus 5?+
Цената е 5 долара за милион входни токена и 25 долара за милион изходни — същата като при Opus 4.8 и наполовина спрямо Fable 5. Fast mode се таксува на двойна цена.
По-добър ли е Opus 5 от Fable 5?+
При повечето показатели в таблицата на Anthropic Opus 5 води, но Fable 5 остава напред при правните задачи и е на практика равен при FrontierCode. Числата са от вътрешни тестове на компанията.
Къде мога да ползвам Opus 5?+
Моделът е наличен във всички платени планове на Claude, през Claude API, както и на Amazon Bedrock, Google Cloud и Microsoft Foundry. В плана Max той е основният модел.
Какъв контекст поддържа Opus 5?+
Контекстният прозорец е 1 милион токена, а изходът стига до 128 000 токена. При пакетната обработка лимитът може да се вдигне до 300 000 токена с бета заглавка.
Може ли Opus 5 да се ползва за работа по киберсигурност?+
Моделът открива уязвимости в изходен код, но защитните класификатори блокират сканиране на двоични файлове, тестове за проникване и генериране на exploit. За фирми Anthropic предлага отделна програма за проверка.

Заключение: новият лидер ли е Opus 5?

Claude Opus 5 е лидер при повечето измервания, но не при всички. Моделът удвоява резултата на предшественика си при агентното кодиране, чупи досегашния таван при ARC-AGI-3 и запазва цената на Opus 4.8.

Слабите места са две и си струва да се помнят. Част от задачите остават по-добре решени от GPT-5.6 Sol, Fable 5 и Mythos 5, а всички числа идват от вътрешни тестове.

Ако плащате за агентна работа, преминаването към Opus 5 изглежда логично още сега. Ако търсите категоричен победител в цялата индустрия, изчакайте независимите класации — те обикновено пристигат след няколко седмици.

Допълнителни ресурси

Официален сайт:Посетете сайта →
// Споделете
𝕏FBLI
ИД
Иван Драганов

Основател на CyberNinjas.ai и Кибер Хора. Пише за AI инструменти, новини и практически ръководства.

// Свързани

Още статии

GPT-5.6 Sol, Terra и Luna — новите модели на OpenAI с ограничен достъп
Категория: AI Новини

GPT-5.6 Sol, Terra и Luna: новите модели на OpenAI [2026]

GPT-5.6 Sol, Terra и Luna са новите модели на OpenAI от юни 2026 — цени, бенчмаркове и защо достъпът е ограничен по искане на властите в САЩ. Ето какво носят.

9 мин.
Claude Sonnet 5 — агентен AI модел на Anthropic, който работи автономно с инструменти
Категория: AI Новини

Claude Sonnet 5: по-евтиният агентен AI модел [2026]

Claude Sonnet 5 е новият агентен AI модел на Anthropic от юни 2026 — с 1M контекст, цени от 2 долара и производителност близо до Opus 4.8. Ето какво носи.

9 мин.