Autres blogs
Les derniers mois ont été agités du côté des LLM. On a vu passer GPT-5 (7 août), GPT-5.1 (12 novembre) et tout récemment Gemini 3 (19 novembre).
Pour GrandpaCAD, mon outil de texte vers 3D, ça compte. Je me fiche des benchmarks sur la poésie ou les hallucinations. Une seule chose m'intéresse : le modèle sait-il écrire du code qui génère un objet 3D imprimable ?
J'ai lancé 84 générations par modèle pour le savoir.
Pour donner une idée de l'échelle : j'ai brûlé 6 millions de jetons sur Gemini 3 dans les seules 24 premières heures suivant sa sortie. Ce n'est pas un test « au feeling ». Je crois avoir une approche assez guidée par les données.
J'ai utilisé mon banc d'évaluation habituel. C'est-à-dire 27 prompts uniques, allant d'un simple « arbre low poly » à un « dragon imprimable sans supports » autrement plus complexe. Chaque prompt est joué 3 fois pour lisser la variance.
Ce cadre a désormais suivi 29 campagnes d'évaluation complètes, pour 1 050 modèles 3D au total. J'ai cumulé 2 664 minutes (plus de 44 heures) de génération et dépensé 186,26 $ de coûts d'API pour constituer ce jeu de données.
Vous pouvez consulter les données brutes sur la page /evals. Notez que cette page est un document vivant : les campagnes passées peuvent ne pas correspondre exactement si j'ai retouché le banc depuis.
Voici comment ils se situent.
| Métrique | Gemini 3 | GPT-5 | GPT-5.1 |
|---|---|---|---|
| Score pondéré | 0,555 | 0,501 | 0,467 |
| Taux de réussite | 79,76 % | 80,95 % | 67,86 % |
| Conformité | 0,57 | 0,54 | 0,46 |
| Coût moyen | 0,14 $ | 0,18 $ | 0,26 $ |
| Durée moyenne | 1 min 24 s | 3 min 26 s | 1 min 12 s |
| Coût total (84 passages) | 12,05 $ | 15,40 $ | 22,13 $ |
Gemini 3 est le vainqueur net pour ma charge de travail. Il a le meilleur score pondéré (0,555) et la meilleure conformité aux prompts (0,57). Surtout, c'est aussi le moins cher (12,05 $ au total) et il est très rapide.
GPT-5.1 a été une surprise. Il est incroyablement rapide (1 min 12 s en moyenne), mais le coût (22,13 $ au total) est gonflé parce que j'ai lancé ce benchmark avec le service_tier: priority d'OpenAI. Ce réglage double le prix pour un gain de vitesse modeste de 20 à 30 % sur ce modèle. Même sans priorité il est rapide, mais la qualité en a pris un coup avec un taux de réussite de seulement 67,86 %. Pour l'instant, la vitesse ne vaut pas la perte de fiabilité.
GPT-5 reste une option solide, quoique lente. Il a d'ailleurs eu le meilleur taux de réussite (80,95 %), mais il lui faut plus de 3 minutes par génération en moyenne (sans le palier prioritaire).
Les chiffres ne racontent pas toute l'histoire. Gemini 3 a quelque chose de différent. Il est fantasque.
Quand je demandais aux modèles précédents un « pot 3D empilable », j'obtenais généralement un cylindre avec un rebord. Fonctionnel, mais ennuyeux. Gemini 3 a produit quelque chose de vraiment créatif.

Il a aussi un bien meilleur sens du raisonnement spatial. Je teste souvent les modèles avec : « Fais un support de smartphone simple qui peut tenir un téléphone à la verticale et à l'horizontale. »
La plupart des modèles peinent à placer correctement la fente ou le dossier par rapport au centre de gravité du téléphone. Gemini 3 a immédiatement trouvé la bonne échelle relative et le bon positionnement. Même si les campagnes d'évaluation n'ont pas donné les meilleurs résultats, j'ai vu avec lui de meilleurs résultats que je n'en avais jamais obtenus avec aucun autre modèle.

Ma copine, qui teste patiemment ces générations avec moi (et finit d'habitude agacée), a vraiment remarqué la différence.
« Vito regarde ça, il s'en est super bien sorti ! »
C'est la première fois qu'une amélioration l'enthousiasme. Sur ce projet, la fonction passe avant tout. L'esthétique est un bonus, mais si la pièce ne s'emboîte pas ou ne s'imprime pas, elle ne sert à rien. Gemini 3 semble mieux saisir la nuance de la demande.
Voici une grille de quelques résultats à travers les modèles.
Cliquez sur l'image pour inspecter le modèle
| Prompt | Gemini 3 | GPT 5.1 | GPT 5 |
|---|---|---|---|
| Make a chess queen piece | |||
| Make a beautiful dog tag with configurable name and phone number on it | |||
| Make a low-poly tree with a stable, flat base suitable for tabletop models. | |||
| Make a simple smartphone stand that can hold a phone vertically and horizontally. | |||
| Make a miniature coffee cup with handle and hollow interior, printable without supports. | |||
| Make a small dragon figurine, about 8 cm tall, standing on a 3 cm circular base, with detailed wings and scales. Ensure all parts are printable without overhangs exceeding 45°, and hollow the interior to reduce material usage. | |||
| Make a bird house out of 4 pieces: 1. The roof. 2. The walls with base. 3. The perch. 4. The removable tray that slides in and out from the bottom of the house to remove the trash. The roof should be attached with pegs. | |||
| Make a chess Knight Piece | |||
| Make a cookie cutter set (tree, bell, snowflake, star) | Failed |
Tout n'est pas parfait. Et il y a beaucoup d'échecs chez tous les modèles.
Je bascule le modèle par défaut sur Gemini 3. La combinaison d'une forte conformité, d'un coût bas et d'un raisonnement spatial « de bon sens » en fait le meilleur choix pour la génération 3D en ce moment.
Voulez-vous voir d'autres benchmarks à venir sur la génération 3D ?
Envie d'essayer la génération de modèles 3D ?