Claude Opus 5: ta pati kaina, dvigubai geresni rezultatai
Data: 2026 m. liepos 24 d.
„Anthropic" išleido Claude Opus 5 ta pačia kaina kaip Opus 4.8. Kodo ir problemų sprendimo testai rodo dvigubai geresnį našumą.
Trumpai (TL;DR):
„Anthropic" išleido Claude Opus 5 ta pačia kaina kaip Opus 4.8: 5 USD už milijoną įvesties tokenų, 25 USD už išvesties.
Kodo ir žinių darbo testuose modelis dvigubai lenkia Opus 4.8, o ARC-AGI 3 rezultatas tris kartus viršija artimiausio konkurento balą; kasdieniam naudojimui modelis artėja prie ribinės „Claude Fable 5" klasės.
Kibernetinio saugumo srityje Opus 5 lieka apribotas: negeneruoja išnaudojimo kodų. Sprendimas sąmoningas.
Kaina fiksuota, galia – ne
Claude Opus 5 kainuoja tiek pat, kiek pirmtakas: 5 USD už milijoną įvesties tokenų, 25 USD už išvesties. Tokia kainodara būtų logiška, jei našumas augtų šiek tiek. Frontier-Bench v0.1 testas rodo ką kita: Opus 5 ne tik lenkia visus konkurentus, bet ir daugiau nei dvigubai viršija Opus 4.8 rezultatą. Tame pačiame kainų lygyje.
CursorBench 3.2, matuojantis kodo rašymą realiomis sąlygomis, rodo Opus 5 pasiekiant „Claude Fable 5" piko rezultatą už pusę kainos. IT įmonei, kuri šiandien skaičiuoja API sąnaudas, Opus 5 yra pirmas modelis, kurį verta atidžiai apsvarstyti.
ARC-AGI 3 skaičius, kurį sunku ignoruoti

ARC-AGI testai matuoja gebėjimą spręsti naujus, nematytus uždavinius. Ne įsimintus atsakymus, o tikrą prisitaikymą. Opus 5 čia pasiekė tris kartus aukštesnį balą nei kitas geriausias modelis. Trys kartai, ne dvidešimt procentų.
Zapier AutomationBench testas, vertinantis savarankišką verslo užduočių atlikimą nuo pradžios iki pabaigos, parodė 1,5 karto geresnį praėjimo rodiklį nei artimiausias konkurentas ta pačia kaina. Net žemiausiame effort parametro lygyje Opus 5 įveikė daugiau užduočių nei bet kuris kitas modelis. Tai jau ne kodo rašymas. Tai agentais grįstas darbas: modelis dirba pats, be žmogaus rankų prie klaviatūros.
Kai modelis susikuria savo įrankį

„Anthropic" pateikia kelis konkrečius pavyzdžius iš ankstyvosios prieigos testavimo. Ryškiausias: Frontier-Bench užduotyje modeliui buvo duotas mašinos dalies piešinys ir paprašyta sukurti FreeCAD 3D modelį kodu. Sąlygos sąmoningai apsunkintos: modelis negalėjo tiesiogiai matyti piešinio.
Opus 5 nesustojo. Parašė savo computer vision (kompiuterinio regėjimo) apdorojimo grandinę, kuri geometriją ištraukė tiesiai iš neapdorotų pikselių, tada atkūrė visą mašinos dalį. Pakartojo tai kelis kartus iš eilės. Nė vienas konkurencinis modelis nesugebėjo to padaryti per penkis bandymus.
Prekybos įmonės inžinierius per vieną sesiją su Opus 5 sukūrė rinkos duomenų srautą naujai biržai. Ankstesni modeliai šios užduoties neįveikė net su išsamiais planais. Neradęs realaus srauto kodo patikrinimui, Opus 5 pats sukūrė testavimo aplinką. Tai konkretūs, aprašyti atvejai su tikrais rezultatais, ne abstraktūs teiginiai apie revoliuciją.
Kibernetinis saugumas: čia riba

Opus 5 leidžia ieškoti pažeidžiamumų programų kode. Tačiau blokuoja dvejetainiu kodu grįstą pažeidžiamumo skenavimą, pentesting įrankius ir išnaudojimo kodo generavimą. Lyginant su „Claude Fable 5", saugumo klasifikatoriai Opus 5 atveju įsikiš maždaug 85% rečiau: mažiau trinties su teisėtais saugumo specialistais.
OSS-Fuzz teste Opus 5 ir „Mythos 5" randa pažeidžiamumus panašiai sėkmingai. Bet išnaudojimo kodo kūrime Opus 5 lieka gerokai už „Mythos 5". „Anthropic" tai apibūdina kaip sąmoningą sprendimą, ne techninį apribojimą: šis modelis net nėra treniruojamas kibernetinėms užduotims. Opus 5 pagerėjo šioje srityje tiesiog todėl, kad tapo bendrai galingesnis. Platesnei prieigai kibernetiniams tyrimams veikia Cyber Verification Program (CVP), į kurią gali kreiptis įmonės ir tyrinėtojai.
Suderinimas su taisyklėmis: geriausias iki šiol
Automatinis elgesio auditas testavimo fazėje parodė, kad Opus 5 yra suderintiausias „Anthropic" modelis. Mažiausios apgaulingo elgesio normos, mažiausias jautrumas manipuliacijoms, mažiausia tikimybė imtis veiksmų su sunkiai atstatomomis pasekmėmis.
Gyvybės mokslų srityje Opus 5 perima Opus 4.8 vietą kaip galingiausias viešai prieinamas modelis mokslinėms užduotims. Ilgalaikėms, autonominėms biologijos tyrimų užduotims lieka rezervuotas „Mythos 5".
Praktinė pusė
Opus 5 nuo šiandien prieinamas visose platformose. Naujas numatytasis modelis Claude Max, stipriausias Claude Pro. Fast mode veikia maždaug 2,5 karto greičiau už standartinį, kaina dviguba.
Beta versijoje išleidžiamos dvi papildomos funkcijos. Pirma: pokalbio metu galima keisti, kuriuos įrankius Claude gali naudoti, neprarandant prompt cache talpyklos. Antra: API lygyje galima įjungti automatinius atsarginius maršrutus, kad saugumo klasifikatoriaus sulaikyta užklausa automatiškai persiunčiama į kitą modelį, o ne tiesiog blokuojama. Duomenų saugojimo reikalavimai bendrajai prieigai, kaip ir su Opus 4.8, nėra.
Ponas Obuolys sako:
„Anthropic" išleido modelį, kuris kainuoja tiek pat, bet veikia geriau. Tai ne revoliucija, tai verslas kaip turėtų veikti. Bet 2025-aisiais tai vis tiek atrodo kaip staigmena.
Labiausiai sudomino ne benchmarkai, o FreeCAD atvejis. Modelis negalėjo matyti piešinio. Neparašė klaidos pranešimo. Susikūrė savo akis. Vilniaus startuoliams, kurie šiandien svarsto, kaip sumažinti inžinierių komandas: šis atvejis atsako geriau nei bet kuri skaidrė iš konferencijos.
Kibernetinio saugumo apribojimai atrodo pagrįsti. Ne todėl, kad „Anthropic" nori atrodyti atsakinga, o todėl, kad OSS-Fuzz skaičiai paaiškina, kodėl. Pažeidžiamumus modelis suranda gerai. Išnaudoti juos dar nemoka. Tai logiška vieta fiksuoti ribą, bent kol kas.
Šaltiniai: „Anthropic" oficialus pranešimas, „VentureBeat", „InfoQ", „SiliconAngle".