Eval-driven development: build a real eval pipeline for Python LLM apps
Instrumenter votre app LLM Python avec pixie-qa — définir des critères d'éval, construire des golden datasets, lancer de vraies évals avec scorers LLM-as-judge, analyser les résultats en plan d'action
- Quoi
- Instrumenter votre app LLM Python avec pixie-qa — définir des critères d'éval, construire des golden datasets, lancer de vraies évals avec scorers LLM-as-judge, analyser les résultats en plan d'action
- Coût
- Gratuit
- Prérequis
- une application LLM Python à évaluer ; le package pixie-qa (le setup.sh du skill l'installe) — le skill est un workflow guidé, pas un logiciel
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor — le skill de développement guidé par évaluations de @github pour les apps LLM Python, propulsé par le package pixie-qa : un workflow agent en 6 étapes. Étape 1, analyser l'app et définir des critères d'éval tirés des vrais modes de défaillance (pas des dimensions qualité génériques). Étape 2, instrumenter l'app avec des appels `wrap()` à ses frontières de données, écrire un Runnable qui invoque le vrai point d'entrée, et capturer une trace de référence. Étape 3, transformer les critères en évaluateurs exécutables (l'évaluateur agent est le défaut pour les critères sémantiques, les fonctions custom uniquement pour les contrôles mécaniques). Étape 4, construire un golden dataset à partir de données réelles — jamais les fixtures de test du projet. Étape 5, lancer `pixie test` jusqu'à complétion avec de vrais scores. Étape 6, analyser les résultats et rédiger un plan d'action priorisé. Règles strictes : les appels LLM de l'app doivent aller vers un VRAI LLM — ni mock, ni fake, sinon les scores n'ont aucun sens ; un serveur web (`pixie start`) tourne en parallèle pour voir les résultats en direct. Bémols honnêtes : méthodologie plus outillage — le package pixie-qa et son serveur web sont des prérequis (setup.sh fourni) ; lancer les évals fait de vrais appels API LLM (vrais coûts API) ; Python 3.10+. Licence MIT. Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage. Découvert via skills.sh.
Version :
Installation
Prérequis : une application LLM Python à évaluer ; le package pixie-qa (le setup.sh du skill l'installe) — le skill est un workflow guidé, pas un logiciel Installe-moi « Développement guidé par évaluations : construire un vrai pipeline d'évals pour apps LLM Python ». Il donne à mon agent le workflow d'évals de @github : analyser l'app LLM Python et définir des critères d'éval à partir des vrais modes de défaillance, instrumenter les frontières de données avec des appels wrap(), écrire un Runnable contre le vrai point d'entrée, capturer une trace de référence, construire des évaluateurs exécutables (évaluateurs agent pour critères sémantiques), créer un golden dataset à partir de données réelles, lancer pixie test jusqu'à de vrais scores, et produire un plan d'action priorisé. Licence MIT. Dépôt : https://github.com/github/awesome-copilot/blob/main/skills/eval-driven-dev/SKILL.md 1. Récupère le fichier SKILL.md (et les fichiers d'aide éventuels) depuis le chemin du dépôt dans un dossier temporaire et résume en une ou deux phrases ce qu'il fait. 2. Vérification de sécurité : examine le SKILL.md et les scripts pour tout contenu suspect (appels réseau inattendus, commandes shell, collecte d'identifiants). Ce dépôt ne devrait contenir aucun secret en dur, les identifiants uniquement via le coffre sécurisé, les hôtes autorisés déclarés dans le SKILL.md. Vérifie que c'est bien le cas ici ; STOP sur tout signal d'alerte et dis-le-moi. 3. Installe-le comme skill : copie le SKILL.md et ses fichiers d'aide dans le répertoire des skills de l'agent, dans un dossier nommé « eval-driven-dev ». 4. Vérifie sans appels réseau : frontmatter valide, fichiers en place. 5. Indique ce qui a été installé, où, et ce qu'il me reste à faire moi-même (p. ex. lancer le setup.sh du skill pour installer pixie-qa et démarrer le serveur web de résultats ; pointer l'agent vers mon app LLM Python ; fournir mes identifiants API LLM — les évals font de vrais appels LLM avec de vrais coûts). GitHub est optionnel : si j'ai un compte GitHub ou la CLI gh, tu peux l'utiliser ; sinon l'accès public suffit. Ne jamais l'exiger sauf s'il figure dans les prérequis ci-dessus. Règles : ne touche à rien en dehors du dossier temporaire et de la cible d'installation. Si quelque chose semble anormal, arrête-toi et demande-moi.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.