ag

HighWalk Benchmark

Pourquoi HighWalk

Ces derniers mois, j'ai travaillé sur l'automatisation des mises à jour de spécifications techniques pour des projets en phase de run. L'enjeu : produire des documents destinés à des équipes humaines (type DSI) avec le bon niveau d'abstraction, aborder l'architecture et les règles métiers sans se noyer dans les détails d'implémentation.

Pour y parvenir, j'ai conçu et affiné une Agent Skill dédiée. Le principal défi réside dans l'évaluation de l'impact réel des modifications de code, puis dans la capacité de rédaction et d'intégration fluide au sein d'un document existant.

J'ai rapidement constaté que des modèles pourtant très performants dans les benchmarks de code pouvaient être mis en difficulté sur cet exercice. C'est pour mesurer cette capacité spécifique à "prendre de la hauteur" qu'est né HighWalk : un benchmark évalué sur la compréhension globale et la documentation, au-delà de la seule écriture de code ou de spécifications à destination d'autres agents.

Protocole, critères et classement

Tâche évaluée : Mise à jour d'un document de spécifications techniques existant à partir de 46 commits, projet Laravel (95 fichiers modifiés, +4 587 / −945 lignes).

Environnement : Runs réalisés avec OpenCode et OpenRouter, providers verrouillés (provider de l'éditeur du modèle, NovitaAI pour DeepSeek).

Qualité brute : Évaluation métier pondérée sur 11 critères. Mesure la capacité à identifier les changements pertinents, les abstraire au bon niveau et les intégrer avec cohérence dans le document. Impasses et ajouts non justifiés pénalisés.

Efficience opérationnelle : Score combinant à parts égales la durée et le coût du run. Les plafonds de 10 minutes et 1,50$ traduisent une contrainte d'usage, dépasser les deux entraîne un score nul.

Score global : Combinaison 80/20 entre qualité brute et efficience opérationnelle. Privilégie la fiabilité de la documentation produite tout en valorisant les configurations utilisables au quotidien.

Répétition : Chaque configuration (modèle, niveau de raisonnement et provider) a été exécutée deux fois. Le meilleur run est retenu pour le classement afin de comparer le potentiel opérationnel des modèles.

Limites : Ce benchmark couvre un seul cas d'usage, un projet et un document de référence. Il ne constitue pas une mesure statistique exhaustive ni une garantie de performance sur d'autres contextes.

Exclusion : Qwen 3.7 Max est exclu du classement car il a altéré le document de façon critique.

Classement 1 : Score global

Classement général de synthèse. Pondération : 80% Qualité brute / 20% Efficience opérationnelle.

Données complètes

Classement 2 : Qualité brute

Ce classement mesure la capacité de l'agent à respecter rigoureusement le cahier des charges, sans considération de temps ni de coût.

Classement 3 : Efficience opérationnelle

Classement normalisé basé sur la rapidité d'exécution et le coût en dollars par run (soumis aux seuils max de 1,50$ et 10 minutes). Sans considération de qualité, ce classement n'est pas pertinent à lui tout seul mais permet deux observations.

Classement 4 : Tâches complétées

Ce critère isole les modèles qui n'ont complètement raté aucun critère. Ce sont les meilleurs alliés pour une revue de code humaine : l'agent a au moins identifié et ébauché 100% des briques demandées.

Observations et enseignements

Mis à jour le 26/07/2026

Écran non compatible.

Veuillez utiliser un appareil avec une largeur supérieure à 320px.