Agent Eval
Comparez des agents de code en face à face sur vos propres tâches : taux de réussite, coût, temps et régularité.
- Quoi
- Comparez des agents de code en face à face sur vos propres tâches : taux de réussite, coût, temps et régularité.
- Coût
- Gratuit
- Prérequis
- Utilisez « Évaluation d'agents » avec votre Muse.
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor : un outil CLI léger et une méthode pour comparer des agents de code en face à face sur des tâches reproductibles que vous définissez en YAML (prompt, fichiers concernés, critères de jugement). Les juges peuvent être déterministes (pytest, build), par motifs (grep) ou par modèle (LLM-as-judge). Chaque exécution d'agent tourne dans son propre git worktree isolé, sans Docker, et le rapport affiche taux de réussite, coût API, temps écoulé et régularité sur plusieurs essais. Bonnes pratiques incluses : 3 à 5 tâches tirées du vrai travail (pas des jouets), 3+ essais par agent, commits épinglés pour la reproductibilité, au moins un juge déterministe par tâche, et suivi du coût en parallèle du taux de réussite. Par @affaan-m, listé ici avec crédit à son créateur. Tiré du dépôt affaan-m/ECC (MIT). Note : le CLI sous-jacent vit dans le dépôt joaquinhuigomez/agent-eval lié par le skill. Bémols honnêtes : orienté développeurs, il faut un dépôt git et les CLI des agents à comparer installés en local. Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage.
Version :
Installation
Copiez le dossier d’installation ci-dessous, puis collez-le dans MuseCréation de la communauté. Skill Harbor ne vérifie pas le code — examinez la source avant de l'installer.
Utilisez « Évaluation d'agents » avec votre Muse. Prérequis : un dépôt git avec de vraies tâches à tester, et les CLI des agents de code à comparer installés sur votre machine (p. ex. Claude Code, Aider, Codex). L'app Muse (mobile ou web) pour la partie planification. 1. Ouvrez le skill : https://github.com/affaan-m/ECC/blob/main/skills/agent-eval/SKILL.md et copiez le texte complet du SKILL.md. 2. Collez-le dans un chat avec Muse et ajoutez : « Aide-moi à définir 3 à 5 tâches de benchmark pour [mon projet] au format YAML agent-eval. Dépôt : [chemin], commit épinglé [sha]. » 3. Installez le CLI agent-eval depuis le dépôt lié par le skill (relisez le code d'abord), rédigez vos YAML de tâches, puis lancez : agent-eval run --task tasks/<nom>.yaml --agent claude-code --agent aider --runs 3 4. Demandez à Muse de vous aider à interpréter le tableau (taux de réussite, coût, temps, régularité) et à trancher. Astuce : partez de tâches tirées de votre vrai travail, pas d'exemples jouets, et incluez toujours au moins un juge déterministe (tests ou build) par tâche. Sécurité : un skill est du texte d'instructions ; il n'exécute rien tout seul. Relisez toute commande avant de l'exécuter, ne collez jamais de secrets dans un chat, et relisez tout ce que Muse propose avant qu'il n'agisse.
Enregistré dans vos installs récentes. Retrouvez-le à tout moment sur /connect.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.