HighWalk Benchmark
- Objectif : Évaluer la capacité des LLM à mettre à jour un document de spécifications techniques à partir de changements de code.
- Compétences requises : Demande de solides capacités d'analyse de code, d'abstraction technique et de rédaction, le tout dans un document existant.
- Périmètre : 46 commits, 95 fichiers modifiés (+4 587 / -945 lignes), projet Laravel.
Pourquoi HighWalk
Ces derniers mois, j'ai travaillé sur l'automatisation des mises à jour de spécifications techniques pour des projets en phase de run. L'enjeu : produire des documents destinés à des équipes humaines (type DSI) avec le bon niveau d'abstraction, aborder l'architecture et les règles métiers sans se noyer dans les détails d'implémentation.
Pour y parvenir, j'ai conçu et affiné une Agent Skill dédiée. Le principal défi réside dans l'évaluation de l'impact réel des modifications de code, puis dans la capacité de rédaction et d'intégration fluide au sein d'un document existant.
J'ai rapidement constaté que des modèles pourtant très performants dans les benchmarks de code pouvaient être mis en difficulté sur cet exercice. C'est pour mesurer cette capacité spécifique à "prendre de la hauteur" qu'est né HighWalk : un benchmark évalué sur la compréhension globale et la documentation, au-delà de la seule écriture de code ou de spécifications à destination d'autres agents.
Protocole, critères et classement
Tâche évaluée : Mise à jour d'un document de spécifications techniques existant à partir de 46 commits, projet Laravel (95 fichiers modifiés, +4 587 / −945 lignes).
Environnement : Runs réalisés avec OpenCode et OpenRouter, providers verrouillés (provider de l'éditeur du modèle, NovitaAI pour DeepSeek). Les modèles qui supportent plusieurs niveaux de raisonnement sont évalués sur leur niveau par défaut ainsi qu'un niveau plus élevé quand disponible.
Qualité brute : Évaluation métier pondérée sur 11 critères. Mesure la capacité à identifier les changements pertinents, les abstraire au bon niveau et les intégrer avec cohérence dans le document. Certains critères n'impliquent pas forcément d'ajout ou de modification : il peut s'agir d'identifier un changement comme non pertinent. Impasses et ajouts non justifiés pénalisés.
Efficience opérationnelle : Score combinant à parts égales la durée et le coût du run. Les plafonds de 10 minutes et 1,50$ traduisent une contrainte d'usage, dépasser les deux entraîne un score nul.
Score global : Combinaison 80/20 entre qualité brute et efficience opérationnelle. Privilégie la fiabilité tout en valorisant les configurations utilisables au quotidien.
Répétition : Chaque configuration (modèle, niveau de raisonnement et provider) a été exécutée deux fois. Le meilleur run est retenu pour le classement afin de comparer le potentiel opérationnel des modèles.
Limites : Ce benchmark couvre un seul cas d'usage, un projet et un document de référence. Il ne constitue pas une mesure statistique exhaustive ni une garantie de performance sur d'autres contextes.
Exclusion : Qwen 3.7 Max est exclu car il a altéré le document de façon critique.
Classement 1 : Score global
Classement général de synthèse. Pondération : 80% Qualité brute / 20% Efficience opérationnelle.- Pour la première fois, deux modèles open-weight dominent le classement général : GLM 5.3 (high) prend une avance nette sur Qwen 3.8 Max (medium) : il combine le meilleur score de qualité brute à une efficience opérationnelle solide, tout en ne ratant aucune tâche, c'est le premier modèle à finir premier sur ces 3 critères.
- Grok 4.5 (high) prend la troisième place, suivi de près par Claude Opus 5 (high), dont la moindre efficience opérationnelle est compensée par son excellent score de qualité brute.
- Suivent GPT 5.6 Sol (low), qui se démarque des autres niveaux d'efforts proposés par Sol, et GPT 5.6 Terra (medium).
Classement 2 : Qualité brute
Ce classement mesure la capacité de l'agent à respecter rigoureusement le cahier des charges, sans considération de temps ni de coût.- GLM 5.3 (high) réussit à dépasser Claude Opus 5 (high) sur la qualité bruté, creusant l'écart avec le reste des modèles de ce classement.
- Qwen 3.8 Max (medium) prend la deuxième place. Suivent GPT 5.6 Sol (xhigh), Claude Sonnet 5 (high) et Grok 4.5 (high).
- La variante high de Claude Opus 5 fait mieux que la variante xhigh, un point qu'on observe pour plusieurs modèles pour lesquels le raisonnement le plus haut n'est pas celui qui produit les meilleurs résultats.
Classement 3 : Efficience opérationnelle
Classement normalisé basé sur la rapidité d'exécution et le coût en dollars par run (soumis aux seuils max de 1,50$ et 10 minutes). Sans considération de qualité, ce classement n'est pas pertinent à lui tout seul mais permet deux observations :- Kimi K3 offre un score d'efficience opérationnelle relativement bas, bien en dessous de Kimi K2.6 mais aussi de GLM 5.3 et de Qwen 3.8 Max (qui devancent largement en qualité brute).
- GPT 5.6 Sol (xhigh) est dernier sur l'efficience opérationnelle : c'est de loin le modèle le plus cher et celui qui prend le plus de temps. Son score d'efficience opérationnelle est nul car il dépasse les plafonds de coût et de durée.
Classement 4 : Tâches complétées
Ce critère isole les modèles qui n'ont complètement raté aucun critère. Ce sont les meilleurs alliés pour une revue humaine : l'agent a au moins identifié et ébauché 100% des briques demandées.- GLM 5.3 (high), GPT 5.6 Terra (xhigh), Claude Fable 5 (high) et Claude Opus 5 (xhigh) se distinguent par leur taux de couverture de 100%. Cette exhaustivité peut se faire au détriment de la pertinence des changements, à l'exception de GLM 5.3 (high) qui brille sur tous les tableaux..
Observations et enseignements
Les mesures se basent ici sur le coût API. Avec un abonnement, certains modèles peuvent retrouver un meilleur intérêt économique. Le choix final dépend donc aussi du mode d'accès.- GLM 5.3 (high) est le premier modèle qui parvient à combiner meilleur score global, meilleur score de qualité brute et 100% de taux de couverture : il devient de loin la meilleure configuration globale pour cette tâche. Il devance bon nombre de modèles, et distance de très loin ses concurrents open-weight. Son efficience opérationnelle est également solide.
- Le seul autre modèle open-weight à lui tenir tête est Qwen 3.8 Max (medium).
- GPT 5.6 Sol (xhigh) obtient un bon score de qualité brute,mais une efficience opérationnelle qui tombe à 0 car dépassant les plafonds budget/temps. On lui préfèrera même sa version low qui tire son épingle du jeu.
- Un effort de raisonnement supérieur ne garantit pas un meilleur résultat : Claude Opus 5 fait mieux en high qu'en xhigh, une tendance également observée sur Qwen 3.8 Max, Claude Sonnet 5, et d'autres. Claude Opus 4.8 montre l'inverse. L'effort n'est pas un levier à maximiser par défaut.
- Enfin, 4 modèles n'ont aucune hard failure : GLM 5.3 (high), GPT 5.6 Terra (xhigh), Claude Fable 5 (high) et Claude Opus 5. Ils constituent les points de départ les plus rassurants pour une revue humaine.
Mis à jour le 23/08/2026
- EN
- FR