Eval Harness
Pratiquez le développement piloté par les évals : définissez les évals de capacité et de régression avant de coder, notez, suivez pass@k.
- Quoi
- Pratiquez le développement piloté par les évals : définissez les évals de capacité et de régression avant de coder, notez, suivez pass@k.
- Coût
- Gratuit
- Prérequis
- Utilisez « Harnais d'évaluation » avec votre Muse.
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor : un cadre formel de développement piloté par les évals (EDD) pour les sessions de code IA. Les évals sont les tests unitaires du développement IA : définissez les évals de capacité (l'agent peut-il faire quelque chose de nouveau) et de régression (un changement a-t-il cassé l'existant) AVANT l'implémentation, puis notez avec des correcteurs déterministes (code), des rubriques LLM-as-judge, ou une révision humaine avec niveaux de risque. Métriques : pass@k (au moins un succès en k essais) et pass^k (k essais tous réussis, la barre haute pour les chemins critiques), avec seuils recommandés (pass@3 >= 0,90 en capacité, pass^3 = 1,00 pour les régressions critiques). Inclut le workflow d'éval (définir, implémenter, évaluer, rapporter), le layout de stockage (.claude/evals/ : définitions, journaux, baselines), les anti-motifs d'évals (sur-ajuster les prompts aux exemples d'éval, ne mesurer que le chemin heureux, correcteurs instables dans les grilles de release), et les bonnes pratiques (définir avant de coder, correcteurs déterministes d'abord, versionner les évals avec le code). Note : les utilitaires d'exemple du skill décrivent un cadre de capsules et de replay où l'exécution des candidats est désactivée par conception (pas de backend de confinement OS vérifié) ; les vérifications statiques ne sont pas des preuves d'exécution. Par @affaan-m, listé ici avec crédit à son créateur. Tiré du dépôt affaan-m/ECC (MIT). Bémols honnêtes : un cadre de méthode, pas un exécuteur automatique ; certains chemins suivent les conventions Claude Code. Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage.
Version :
Installation
Copiez le dossier d’installation ci-dessous, puis collez-le dans MuseCréation de la communauté. Skill Harbor ne vérifie pas le code — examinez la source avant de l'installer.
Utilisez « Harnais d'évaluation » avec votre Muse. Prérequis : l'app Muse (mobile ou web). Aucune installation, aucune clé API. Un cadre de méthode, pas un exécuteur automatique. 1. Ouvrez le skill : https://github.com/affaan-m/ECC/blob/main/skills/eval-harness/SKILL.md et copiez le texte complet du SKILL.md. 2. Collez-le dans un chat avec Muse et ajoutez : « Mets en place le développement piloté par les évals pour [fonctionnalité ou tâche d'agent]. Définis d'abord les évals de capacité et de régression, avec des cibles pass@k. » 3. Demandez à Muse de rédiger les définitions d'évals, de choisir les types de correcteurs (code d'abord, correcteur modèle pour l'ouvert, humain pour le risqué), et de produire le format de rapport après chaque ronde. Astuce : définissez les évals avant toute implémentation. Les écrire après, c'est juste documenter ce que vous avez déjà construit. Sécurité : un skill est du texte d'instructions ; il n'exécute rien tout seul. Ne collez jamais de secrets dans un chat, et relisez tout ce que Muse propose avant qu'il n'agisse.
Enregistré dans vos installs récentes. Retrouvez-le à tout moment sur /connect.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.