Autres blogs
Claude Opus 5 est sorti, alors j'ai pointé la suite d'évaluation dessus. 23 scénarios, rejoués à travers le véritable agent conversationnel avec les vrais outils CAO, rien de simulé. La méthodologie est ici si vous voulez le détail.
J'ai fini par le lancer trois fois. Les deux premiers ne différaient que par l'effort de raisonnement. Le troisième ne changeait que le fournisseur par lequel passaient les requêtes. Chacun de ces changements d'une ligne a bougé les chiffres davantage que le choix d'un autre modèle ne l'aurait fait.
Ces trois-là sont tous passés par OpenRouter, donc la comparaison des efforts est à armes égales.
| Métrique | Opus 5 (bas) | Opus 5 (élevé) | Fable 5 (bas) | Gemini 3.6 Flash |
|---|---|---|---|---|
| Vérifications déterministes | 84 % | 69 % | 81 % | 85 % |
| Erreurs de code | 0 | 5 | 2 | 8 |
| Coût total | 13,99 $ | 19,39 $ | 12,17 $ | 5,23 $ |
| Durée moyenne | 116 s | 275 s | 94 s | 107 s |
Pas « plus cher pour un petit gain ». Pire. L'effort bas était 28 % moins cher, 2,4 fois plus rapide, et passait de cinq erreurs de code à zéro, tandis que le score de conformité du juge bougeait à peine (0,92 contre 0,90, du bruit à cette taille d'échantillon).
Le motif des échecs l'explique. À effort élevé, 30 des 33 vérifications ratées étaient des dépassements de budget en coût ou en durée, pas de mauvaises réponses. Le modèle ne se trompait pas sur la géométrie. Il réfléchissait au-delà de l'horloge. Deux scénarios multi-tours ont défoncé le délai de 10 minutes par génération et ont été tués en cours de route. À effort bas, aucun dépassement de délai, et une seule défaillance de coût restante.
J'ai déjà vu ça. À l'époque des campagnes GPT-5, le raisonnement moyen battait l'élevé pour environ la moitié du prix. Même forme, sauf que cette fois le haut de l'échelle n'a pas seulement échoué à justifier sa taxe, il a activement perdu.

Mon premier réflexe a été de croire que Fable 5 l'emportait haut la main, puisque le passage de Fable à effort bas était moins cher et plus rapide qu'Opus 5 à effort élevé. Cette comparaison ne valait rien. Je mettais l'effort bas d'un modèle contre l'effort élevé d'un autre.
Correctement appariés, à effort bas des deux côtés, ils sont quasiment à parité : Opus 5 coûte 1,15 fois et prend 1,22 fois le temps réel, et marque un peu mieux sur les vérifications déterministes avec zéro erreur de code contre deux pour Fable. À noter que le tarif affiché de Fable est le double de celui d'Opus 5, donc Opus consomme quand même plus de jetons par tâche. Juste pas assez pour changer la réponse.
Voilà celle que je n'attendais pas. J'ai relancé la configuration gagnante, effort bas, contre l'API Anthropic de première main plutôt qu'OpenRouter. Même modèle, même effort, mêmes 23 scénarios, même jour.
| Opus 5, effort bas | Anthropic en direct | OpenRouter |
|---|---|---|
| Coût total | 9,05 $ | 13,99 $ |
| Vérifications déterministes | 87/106 | 89/106 |
| Erreurs de code | 1 | 0 |
| Durée moyenne | 108 s | 116 s |
La qualité, c'est bonnet blanc et blanc bonnet. Le coût, non : 35 % moins cher, et moins cher dans 22 des 23 scénarios, ce qui est trop régulier pour être du bruit. Les deux passages ont fait exactement 33 appels au LLM, donc il n'en fait pas moins non plus.
Ma première hypothèse était que notre propre comptabilité des coûts était fausse, qu'OpenRouter ne remontait simplement pas les jetons mis en cache dans le champ que nous lisons. J'ai donc sondé les deux fournisseurs avec un préfixe répété, et j'avais tort : OpenRouter remonte correctement les lectures de cache. Ce que la sonde a bel et bien montré, c'est que sa mise en cache de premier niveau écrit le préfixe au tarif 1,25x la première fois qu'elle en voit un. Sur 23 scénarios largement indépendants, ces écritures ne sont pas relues assez souvent pour se rentabiliser. Ce dernier pas relève de l'inférence plutôt que d'une mesure par requête, mais la direction est cohérente sur presque tous les scénarios.
Bon à savoir si vous passez par une passerelle par confort. La passerelle n'est pas neutre sur le coût, même quand c'est le même modèle en dessous et que les prix des jetons sur le papier sont identiques.
Gemini 3.6 Flash reste le choix par défaut pour l'instant. Il est toujours moins cher qu'Opus 5 à effort bas pour un taux de réussite comparable, et le coût par génération est le chiffre qui tranche pour un produit où les gens itèrent. La découverte sur les fournisseurs resserre l'écart, cela dit : face au passage de première main à 9,05 $ plutôt qu'aux 13,99 $ de la passerelle, l'avance de Gemini se réduit d'environ 2,7x à 1,7x.
Ce qui tire dans l'autre sens, c'est la colonne des erreurs. Gemini a produit 8 erreurs de code sur la suite, Opus 5 à effort bas en a produit zéro ou une selon le fournisseur. Une erreur de code n'est pas juste une reprise de notre côté, c'est un utilisateur qui regarde tourner un sablier pendant que l'agent se répare. Je ne bascule pas sur la foi d'un seul passage à 23 scénarios, mais c'est cet écart que je vais surveiller. Et si je bascule, ce sera par la voie de première main.
Chaque passage, y compris les moches, est consigné sur la page des évaluations. Si vous voulez voir ce que les modèles produisent réellement, la visionneuse 3D ouvrira n'importe quel résultat que vous exportez.