Benchmark IA HighWalk
- Un benchmark IA à plusieurs niveaux (modèles, efforts, harnais, skills), pour une évaluation spécialement adaptée à vos tâches et vos enjeux business.
- Prendre de la hauteur par rapport à des workflows et process IA, et sélectionner les bons outils pour optimiser au mieux la qualité et l'efficience opérationnelle.
- Permet des gains significatifs en termes de coûts d'exploitation, à qualité égale ou supérieure.
Genèse de HighWalk
Lorsqu'un de mes projets est passé en phase de run, je me suis penché sur l'automatisation des mises à jour de ses spécifications techniques. L'enjeu : maintenir des documents destinés à des équipes humaines, avec le bon niveau d'abstraction, aborder l'architecture et les règles métiers sans se noyer dans les détails d'implémentation.
Pour y parvenir, j'ai conçu et affiné une Skill dédiée. Le principal défi réside dans l'évaluation de l'impact réel des modifications de code, puis dans la capacité de rédaction et d'intégration fluide au sein d'un document existant.
Des modèles très performants dans les benchmarks de code se sont vite retrouvés en difficulté sur cet exercice. HighWalk a été créé pour évaluer ce workflow : deux mois de runs sur la même tâche, pour analyser quels modèles étaient capables de prendre de la hauteur, dans la compréhension globale et la documentation, au-delà de la seule écriture de code.
Ce premier cas d'usage m'a permis d'élaborer une méthodologie de test et de notation reproductible, adaptable au contexte précis d'une tâche, que je propose désormais à mes clients.
Cas pilote
Protocole, critères et classement
Tâche : Mise à jour d'un document de spécifications existant à partir de 46 commits sur un projet Laravel (95 fichiers modifiés, +4 587 / −945 lignes).
Environnement : Runs réalisés avec OpenCode et OpenRouter, providers verrouillés (provider de l'éditeur du modèle lorsqu'il n'entraîne pas sur les prompts, NovitaAI sinon). Les modèles qui supportent les niveaux de raisonnement ont été évalués sur plusieurs efforts.
Qualité brute : Évaluation métier pondérée sur 11 critères. Elle mesure la capacité à identifier les changements pertinents, les abstraire au bon niveau et les intégrer avec cohérence. Certains critères n'impliquent pas d'ajout : il peut s'agir d'identifier un changement comme non pertinent. Impasses et ajouts non justifiés pénalisés.
Efficience opérationnelle : Durée et coût à parts égales. Les plafonds de 10 minutes et 1,50$ traduisent une contrainte d'usage. Les dépasser tous les deux entraîne un score nul.
Score global : 80% de qualité brute, 20% d'efficience. Chaque configuration a été exécutée deux fois, et le meilleur run a été retenu.

28 juillet : première photo
À la publication, ce sont les modèles frontier propriétaires qui tiennent le haut du classement. On y retrouve notamment Grok 4.5 (le meilleur au global), Claude Opus 5 (le meilleur en qualité brute) et GPT 5.6 Terra. GPT 5.6 Sol obient un bon score de qualité brute, mais son efficience opérationnelle tombe à zéro. Côté open-weight, seuls GLM 5.2 et DeepSeek V4 Pro parviennent à entrer dans le Top 10.
Dès ce premier jeu de runs, un effort de raisonnement supérieur ne semble pas garantir un meilleur résultat pour cette tâche. Le critère d'efficience opérationnelle apparaît également fondamental et élimine d'entrée des configurations économiquement non viables.
14 août : Qwen 3.8 Max et niveau d'effort
Quatre modèles entrent dans le classement, dont Qwen 3.8 Max qui prend la première place au global, c'est le premier modèle open-weight à atteindre ce niveau. Claude Opus 5 reste en tête sur la qualité brute et sur le taux de couverture de 100% des critères. Grok 4.6 reste derrière Grok 4.5 aussi bien en qualité qu'en efficience opérationnelle.
L'effort medium commence à apparaître comme le bon réglage pour beaucoup de modèles. Il apparaît également qu'une nouvelle itération d'un modèle ne signifie pas focément un gain de qualité.
23 août : GLM 5.3, le shift open-weight
Qwen 3.8 Max n'aura été premier open-weight au global que quelques jours, GLM 5.3 change la donne. Il est premier au global, premier en qualité brute, et il couvre 100% des tâches. C'est le premier modèle, open-weight ou non, à mener les trois à la fois, sur un même niveau d'effort.
L'inversion du rapport de force entre modèles open-weight et propriétaires commence à se dessiner. Le critère du taux de couverture devient également un élément différentiant.
22 septembre : un gain d'efficience significatif
Deux mois après le premier run, les modèles open-weight ont pris la tête. Parmi les modèles propriétaires, seul Grok 4.7 tient encore une place en haut de classement. GLM 5.3 reste premier, mais MiMo V2.6 est la vraie surprise. Sa version Flash atteint 90,91% de qualité brute et 100% de taux de couverture pour 0,02$, le coût le plus faible jamais constaté à ce niveau de qualité.
Le constat est sans appel : le haut du classement est maintenant trusté par des modèles open-weight, il n'aura fallu que deux mois pour que la tendance s'inverse. Un modèle se démarque pour cette tâche et nous permet d'atteindre une réduction de coût de 100x à qualité égale.
Résultats et enseignements
- Augmenter l'effort de raisonnement n'est pas un levier à maximiser par défaut. Sur cette tâche, un niveau plus élevé a souvent produit des résultats moins qualitatifs.
- En deux mois, les modèles open-weight ont renversé le classement. Les derniers modèles propriétaires sont devenus plus difficiles à justifier d'un point de vue budgétaire.
- À l'arrivée, une configuration se démarque et nous permet d'atteindre une réduction de coût de 100x à qualité égale.
28 juillet – 22 septembre 2026
- EN
- FR