Drugi blogi
Claude Opus 5 je izšel, zato sem nanj usmeril svoj nabor evalvacij. 23 scenarijev, pognanih skozi pravega klepetalnega agenta z resničnimi CAD orodji, nič simuliranega. Metodologija je tukaj, če vas zanimajo podrobnosti.
Na koncu sem ga pognal trikrat. Prva dva zagona sta se razlikovala le v naporu sklepanja. Pri tretjem sem spremenil samo to, prek katerega ponudnika so šle zahteve. Obe enovrstični spremembi sta številke premaknili bolj kot izbira drugega modela.
Vsi trije zagoni so šli prek OpenRouterja, zato je primerjava napora poštena.
| Meritev | Opus 5 (nizek) | Opus 5 (visok) | Fable 5 (nizek) | Gemini 3.6 Flash |
|---|---|---|---|---|
| Deterministična preverjanja | 84 % | 69 % | 81 % | 85 % |
| Napake v kodi | 0 | 5 | 2 | 8 |
| Skupni strošek | 13,99 $ | 19,39 $ | 12,17 $ | 5,23 $ |
| Povprečno trajanje | 116 s | 275 s | 94 s | 107 s |
Ne »dražji za drobno izboljšavo«. Slabši. Nizek napor je bil 28 % cenejši in 2,4-krat hitrejši, napake v kodi pa so s petih padle na nič, medtem ko se je sodnikova ocena skladnosti komaj premaknila (z 0,92 na 0,90, kar je pri tej velikosti vzorca šum).
Vzorec napak to pojasni. Pri visokem naporu je bilo 30 od 33 neuspelih preverjanj prekoračitev dovoljenega stroška ali trajanja in ne napačnih odgovorov. Model ni zgrešil geometrije – premlevanje ga je odneslo čez časovno omejitev. Dva scenarija z več koraki pogovora sta prebila 10-minutno omejitev na generiranje, zato ju je sistem prekinil sredi izvajanja. Pri nizkem naporu ni bilo nobene prekoračitve časa, ostala je le ena napaka zaradi stroška.
To sem videl že prej. Že pri zagonih GPT-5 je srednja stopnja sklepanja premagala visoko, in to za približno polovično ceno. Ista slika, le da tokrat vrh lestvice svojega pribitka ni upravičil, ampak je naravnost izgubil.

Sprva sem mislil, da je Fable 5 odnesel zmago, saj je bil njegov zagon pri nizkem naporu cenejši in hitrejši od Opusa 5 pri visokem. Ta primerjava je bila zanič. Nizek napor enega modela sem postavljal proti visokemu naporu drugega.
Če ju primerjam pošteno, torej pri nizkem naporu na obeh straneh, sta skoraj izenačena: Opus 5 stane 1,15-krat toliko kot Fable 5 in porabi 1,22-krat toliko časa, na determinističnih preverjanjih pa se odreže nekoliko bolje – brez napak v kodi proti dvema pri Fable 5. Velja omeniti, da je Fable po ceniku dvakrat dražji od Opusa 5, kar pomeni, da Opus na nalogo vseeno porabi več žetonov. Le ne dovolj, da bi to spremenilo odgovor.
To pa je tisto, česar nisem pričakoval. Zmagovalno nastavitev, torej nizek napor, sem znova pognal neposredno prek Anthropicovega API-ja namesto prek OpenRouterja. Isti model, isti napor, istih 23 scenarijev, isti dan.
| Opus 5, nizek napor | Anthropic neposredno | OpenRouter |
|---|---|---|
| Skupni strošek | 9,05 $ | 13,99 $ |
| Deterministična preverjanja | 87/106 | 89/106 |
| Napake v kodi | 1 | 0 |
| Povprečno trajanje | 108 s | 116 s |
Kakovost je izenačena. Strošek ni: 35 % ceneje in ceneje v 22 od 23 scenarijev, kar je preveč dosledno, da bi šlo za šum. Oba zagona sta opravila natanko 33 klicev modela, torej cenejši ni opravil manj dela.
Sprva sem ugibal, da je narobe naše štetje stroškov – da OpenRouter predpomnjenih žetonov preprosto ne poroča v polju, ki ga beremo. Zato sem oba ponudnika preizkusil s ponovljeno predpono in motil sem se: OpenRouter branja iz predpomnilnika poroča pravilno. Preizkus pa je pokazal nekaj drugega – njegovo predpomnjenje na najvišji ravni predpono ob prvem pojavu zapiše po 1,25-kratni ceni. Pri 23 večinoma neodvisnih scenarijih se ti zapisi ne preberejo dovolj pogosto, da bi se izplačali. Zadnji člen te razlage je sklep in ne meritev po posamezni zahtevi, a smer je dosledna v skoraj vsakem scenariju.
Dobro je vedeti, če promet zaradi udobja usmerjate prek prehoda. Prehod ni nevtralen glede stroška, tudi kadar je pod njim isti model in so cene žetonov na papirju enake.
Gemini 3.6 Flash za zdaj ostaja privzeti model. Še vedno je cenejši od Opusa 5 pri nizkem naporu, delež uspehov pa je primerljiv; strošek na generiranje je pri izdelku, kjer uporabniki veliko iterirajo, tista številka, ki odloči. Ugotovitev o ponudniku razliko vseeno stisne: če vzamem neposredni zagon za 9,05 $ namesto tistega za 13,99 $ prek prehoda, se Geminijeva prednost skrči z okoli 2,7-kratne na 1,7-kratno.
V drugo smer vleče stolpec z napakami. Gemini je v celotnem naboru vrnil 8 napak v kodi, Opus 5 pri nizkem naporu nobene ali eno, odvisno od ponudnika. Napaka v kodi ni le ponovni poskus na naši strani, temveč uporabnik, ki bulji v vrtečo se ikono, medtem ko se agent popravlja. Zaradi enega samega zagona s 23 scenariji ne bom preklopil, bom pa prav to vrzel spremljal. Če preklopim, bo šlo neposredno prek Anthropica.
Vsi zagoni, tudi grdi, so zabeleženi na strani z evalvacijami. Če želite videti, kaj modeli dejansko izdelajo, bo 3D pregledovalnik odprl kateri koli rezultat, ki ga izvozite.