HighWalk Benchmark
- Objectif : Évaluer la capacité des LLM à mettre à jour un document de spécifications techniques à partir de changements de code.
- Compétences requises : Demande de solides capacités d'analyse de code, d'abstraction technique et de rédaction, le tout dans un document existant.
- Périmètre : 46 commits, 95 fichiers modifiés (+4 587 / -945 lignes), projet Laravel.
Pourquoi HighWalk
Ces derniers mois, j'ai travaillé sur l'automatisation des mises à jour de spécifications techniques pour des projets en phase de run. L'enjeu : produire des documents destinés à des équipes humaines (type DSI) avec le bon niveau d'abstraction, aborder l'architecture et les règles métiers sans se noyer dans les détails d'implémentation.
Pour y parvenir, j'ai conçu et affiné une Agent Skill dédiée. Le principal défi réside dans l'évaluation de l'impact réel des modifications de code, puis dans la capacité de rédaction et d'intégration fluide au sein d'un document existant.
J'ai rapidement constaté que des modèles pourtant très performants dans les benchmarks de code pouvaient être mis en difficulté sur cet exercice. C'est pour mesurer cette capacité spécifique à "prendre de la hauteur" qu'est né HighWalk : un benchmark évalué sur la compréhension globale et la documentation, au-delà de la seule écriture de code ou de spécifications à destination d'autres agents.
Protocole, critères et classement
Tâche évaluée : Mise à jour d'un document de spécifications techniques existant à partir de 46 commits, projet Laravel (95 fichiers modifiés, +4 587 / −945 lignes).
Environnement : Runs réalisés avec OpenCode et OpenRouter, providers verrouillés (provider de l'éditeur du modèle, NovitaAI pour DeepSeek).
Qualité brute : Évaluation métier pondérée sur 11 critères. Mesure la capacité à identifier les changements pertinents, les abstraire au bon niveau et les intégrer avec cohérence dans le document. Impasses et ajouts non justifiés pénalisés.
Efficience opérationnelle : Score combinant à parts égales la durée et le coût du run. Les plafonds de 10 minutes et 1,50$ traduisent une contrainte d'usage, dépasser les deux entraîne un score nul.
Score global : Combinaison 80/20 entre qualité brute et efficience opérationnelle. Privilégie la fiabilité de la documentation produite tout en valorisant les configurations utilisables au quotidien.
Répétition : Chaque configuration (modèle, niveau de raisonnement et provider) a été exécutée deux fois. Le meilleur run est retenu pour le classement afin de comparer le potentiel opérationnel des modèles.
Limites : Ce benchmark couvre un seul cas d'usage, un projet et un document de référence. Il ne constitue pas une mesure statistique exhaustive ni une garantie de performance sur d'autres contextes.
Exclusion : Qwen 3.7 Max est exclu du classement car il a altéré le document de façon critique.
Classement 1 : Score global
Classement général de synthèse. Pondération : 80% Qualité brute / 20% Efficience opérationnelle.- Grok 4.5 (high) termine premier du classement général : il combine un des meilleurs scores qualité à une efficience temps/coût/consommation de tokens inégalée.
- Ce sont ensuite deux modèles de milieu de gamme qui montent sur le podium : GPT 5.6 Terra (medium) et Claude Sonnet 5 (high).
- Ils sont suivis à la 4ème place par un modèle open-weight : GLM 5.2 (xhigh).
Classement 2 : Qualité brute
Ce classement mesure la capacité de l'agent à respecter rigoureusement le cahier des charges, sans considération de temps ni de coût.- GPT 5.6 Sol (xhigh) domine sur la qualité brute, suivi par Claude Sonnet 5 (high) et Grok 4.5 (high).
- La variante high de Claude Sonnet 5 fait mieux d'environ 10% que la variante xhigh, un point qu'on observe pour plusieurs modèles pour lesquels le raisonnement le plus haut n'est pas celui qui produit les meilleurs résultats.
- Gemini 3.1 Pro (high) et les modèles Mistral ferment la marche avec des scores de qualité très faibles.
Classement 3 : Efficience opérationnelle
Classement normalisé basé sur la rapidité d'exécution et le coût en dollars par run (soumis aux seuils max de 1,50$ et 10 minutes). Sans considération de qualité, ce classement n'est pas pertinent à lui tout seul mais permet deux observations.- Kimi K3 offre un score d'efficience opérationnelle relativement bas, bien en dessous de Kimi K2.6 mais aussi de GLM 5.2 (qui le devance en qualité brute).
- GPT 5.6 Sol (xhigh), premier sur la qualité brute, est également dernier sur l'efficience opérationnelle : c'est de loin le plus cher et le plus lent. Son score d'efficience opérationnelle est nul car il dépasse les plafonds de coût et de durée.
Classement 4 : Tâches complétées
Ce critère isole les modèles qui n'ont complètement raté aucun critère. Ce sont les meilleurs alliés pour une revue de code humaine : l'agent a au moins identifié et ébauché 100% des briques demandées.- GPT 5.6 Terra (xhigh) et Claude Fable 5 (high) se distinguent par leur taux de couverture de 100% des critères. Leur couverture totale ne les place pas pour autant en tête : leurs scores de qualité brute et globaux plus faibles suggèrent parfois une exhaustivité au détriment de la pertinence des changements.
Observations et enseignements
- Grok 4.5 (high) s'impose comme le meilleur compromis global grâce à une association qualité brute/efficience opérationnelle sans équivalent. GPT 5.6 Sol (xhigh) obtient la meilleure qualité brute, au prix d'une efficience opérationnelle qui tombe à 0 car dépassant les plafonds de budget et de temps.
- Les modèles de milieu de gamme - Claude Sonnet 5 et GPT 5.6 Terra - tirent leur épingle du jeu de façon remarquable.
- Les mesures se basent ici sur le coût API. Avec un abonnement, certains modèles peuvent retrouver un meilleur intérêt économique. Le choix final dépend donc aussi du mode d'accès.
- Un effort de raisonnement supérieur ne garantit pas un meilleur résultat : Claude Sonnet 5 fait mieux en high qu'en xhigh, une tendance également observée sur DeepSeek V4 Flash/Pro et GPT 5.6 Luna. Claude Opus 4.8 montre l'inverse. L'effort n'est donc pas un levier à maximiser par défaut.
- Les modèles open-weight ne doivent pas être écartés. GLM 5.2 (xhigh) atteint la 4ème place du score global, avec un compromis qualité brute/efficience opérationnelle solide. D'autres modèles de cette catégorie, réputés pour leurs performances, sont cependant mis en difficulté par cette tâche.
- À l'autre extrémité, Gemini 3.1 Pro (high), DeepSeek V4 Flash (xhigh) et les modèles Mistral obtiennent des scores de qualité brute très faibles.
- Enfin, deux configurations n'ont aucune hard failure : GPT 5.6 Terra (xhigh) et Claude Fable 5 (high). Elles constituent les points de départ les plus rassurants pour une revue humaine.
Mis à jour le 26/07/2026
- EN
- FR