Model Evaluation Lab
Évaluations de modèles reproductibles avec plans figés et mémos de décision
- Quoi
- Évaluations de modèles reproductibles avec plans figés et mémos de décision
- Coût
- Gratuit
- Prérequis
- Aucun pour planifier, normaliser et décider — pas de compte, pas de clé API. Un backend d'exécution (endpoint API ou identifiants que vous approuvez) seulement si vous voulez que le skill exécute lui-même les cas de benchmark. Python 3 nécessaire pour les scripts auxiliaires du skill.
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Un skill pour l'agent Muse d'évaluations de modèles reproductibles : figer un plan d'évaluation (décision, baseline, candidats, cas, métriques, budget, règles d'arrêt), exécuter ou normaliser des runs de benchmark, et rédiger un mémo de sélection qui sépare la mesure du jugement. À utiliser pour comparer modèles, prompts, agents ou configurations de déploiement. Il n'invente jamais de scores ni de gagnants — « pas de décision » est un résultat valide et honnête.
Sélectionné par Skill Harbor — build gratuit et open-source (MIT) par @Israelmusondaayliffe.
Version :
Installation
Prérequis : Aucun pour planifier, normaliser et décider — pas de compte, pas de clé API. Un backend d'exécution (endpoint API ou identifiants que vous approuvez) seulement si vous voulez que le skill exécute lui-même les cas de benchmark. Python 3 nécessaire pour les scripts auxiliaires du skill. Pas de compte GitHub nécessaire sauf indication ci-dessus. Installe-moi « Laboratoire d'évaluation de modèles ». Un skill pour l'agent Muse d'évaluations de modèles reproductibles : plans d'évaluation figés, exécution et normalisation de runs de benchmark, mémos de sélection séparant mesure et jugement. Dépôt : https://github.com/Israelmusondaayliffe/muse-skills/tree/main/skills/model-evaluation-lab 1. Récupère le fichier SKILL.md, les scripts et les références depuis le dépôt dans un dossier temporaire et résume ce qu'il fait en une ou deux phrases. 2. Contrôle de sécurité : passe en revue le SKILL.md et les scripts Python pour repérer tout comportement suspect (appels réseau inattendus, commandes système, récolte d'identifiants). Au moindre drapeau rouge, arrête-toi et préviens-moi. 3. Installe-le comme skill : copie SKILL.md, les scripts et les références dans le répertoire de skills de l'agent, dans un dossier nommé « model-evaluation-lab ». 4. Vérifie sans appel réseau : frontmatter valide, scripts Python compilables. 5. Résume-moi : ce qui a été installé, où, et ce qu'il me reste à faire. GitHub est optionnel : si j'ai un compte GitHub ou la CLI gh, tu peux l'utiliser ; sinon l'accès public suffit. Ne l'exige jamais sauf si c'est dans les prérequis ci-dessus. Règles : ne touche à rien en dehors du dossier temporaire et de la cible d'installation. Au moindre doute, arrête-toi et demande-moi.
Questions
Comment installer un skill ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe le skill pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours un skill avant de l’installer.