Autres blogs
Google a sorti Gemini 3.7 Flash hier. Une heure plus tard, il tournait déjà sur GrandpaCAD, et la bascule n'avait rien de palpitant : moins cher que ce qu'on utilisait avant, rapide, et il sort un modèle imprimable du premier coup. Le vrai sujet, c'est une petite expérience que j'ai failli zapper : jusqu'où laisser le modèle réfléchir.
En deux mots : réfléchir davantage a « réglé » un problème qu'on avait déjà réglé, en nous le facturant au passage. On est restés en medium.
3.7 Flash est désormais le modèle par défaut, aussi bien pour le générateur classique que pour le chat agent. Le tarif de lancement est de $0.75 par million de tokens en entrée et $3.75 en sortie, bien en dessous des modèles de pointe sur lesquels on s'appuyait. Pour un usage texte-vers-3D où les gens itèrent (on décrit, on regarde, on ajuste, on redécrit), un modèle rapide et bon marché qui sort une pièce valide vaut mieux qu'un modèle lent et cher, à peine plus joli. C'est exactement l'argument que je défendais en vous disant de tester sur votre propre usage plutôt que sur les classements publics : même idée, nouveau modèle.
Gemini permet de doser l'effort de raisonnement : low, medium, high. J'ai lancé notre suite d'évaluation habituelle deux fois, une en medium et une en high, tout le reste identique. 23 prompts, une seule tentative chacun.

| Métrique | Medium | High |
|---|---|---|
| Modèles produits | 23/23 | 23/23 |
| Erreurs de code au premier essai | 10 | 3 |
| Coût moyen par modèle | $0.105 | $0.142 |
| Temps moyen par modèle | 101s | 117s |
| Ma note de fidélité | 0.80 | 0.72 |
Sur un axe, le mode high a fait exactement ce qu'on espérait. Les erreurs de code au premier essai sont passées de 10 à 3. Les prompts multi-tours brouillons qui font habituellement trébucher un modèle (un support de téléphone qui avait péniblement survécu à trois tentatives ratées en medium) sont sortis nickel du premier coup.
Et malgré ça, il a perdu.

Voilà le truc avec ces erreurs de code : l'utilisateur ne les voit jamais. Quand le code généré plante, l'agent renvoie l'erreur au modèle et il réessaie dans le même tour, avant que quoi que ce soit n'arrive à votre écran. Les deux runs ont produit un modèle fini pour les 23 prompts. Donc « moins d'erreurs au premier essai » est une métrique qui compte surtout du travail qui se passe en coulisses.
Ce qui vous parvient, c'est la pièce finie, l'attente, et (de notre côté) la facture. Sur ces trois points, le mode high faisait pire. Il coûtait environ 35% de plus par modèle et prenait environ 15% de temps en plus. Et quand j'ai noté les résultats à la main, les pièces en high s'en sortaient un peu moins bien sur la fidélité, pas mieux. À cette taille d'échantillon, je considère la fidélité comme match nul, mais c'est justement le point : ce n'était pas meilleur. J'ai payé plus cher pour plus de réflexion et j'ai obtenu les mêmes modèles, en plus lent.
(N'allez pas en déduire un « high a eu de moins bons scores aux vérifications ». Les seules vérifications échouées portaient sur un chrono de 60 secondes, dépassé à cause de la réflexion plus longue. Aucune ne concernait la justesse du résultat.)
Je n'arrête pas de la réapprendre, celle-là. Il y a quelques mois, la mise à niveau vers Gemini 3.1 m'avait montré que le medium battait le high sur le taux d'erreurs. Cette fois, le high a gagné sur le taux d'erreurs et a quand même perdu. Mécanisme inverse, même conclusion : la métrique intermédiaire mentait sur le produit.
Si vous réglez un modèle pour quelque chose de concret, mesurez ce que l'utilisateur reçoit vraiment. Pas les réessais, pas le nombre de tokens, pas la trace de raisonnement. Pour nous, c'est un modèle imprimable, le temps d'attente, et la fidélité au brief. Le taux d'erreurs au premier essai donnait l'impression de compter. Pour un pipeline qui nettoie déjà ses propres erreurs, il ne comptait pas.
C'était notre boucle de test bon marché : une tentative par prompt, pas de juge LLM, mes propres yeux pour noter la fidélité. C'est une tendance, pas un verdict. Une seule tentative par prompt, ça veut dire qu'une partie de ces chiffres est du bruit, et je ne vais pas prétendre que 0.80 contre 0.72 est un résultat net. La suite complète fait trois tentatives avec des juges automatisés, et si elle renverse quoi que ce soit là-dedans, j'en ferai un article. Chaque run, y compris les ratés, est consigné sur la page des évaluations.
Pour l'instant : Gemini 3.7 Flash, réflexion en medium, en ligne sur GrandpaCAD.