scikit-learn best practices: leak-proof pipelines, CV, tuning, and evaluation
Split avant prétraitement, pipelines et column transformers contre les fuites de données, stratégies CV stratifiées, GridSearch/RandomizedSearch, bonnes métriques pour données déséquilibrées et persistance joblib
- Quoi
- Split avant prétraitement, pipelines et column transformers contre les fuites de données, stratégies CV stratifiées, GridSearch/RandomizedSearch, bonnes métriques pour données déséquilibrées et persistance joblib
- Coût
- Gratuit
- Prérequis
- un projet ML Python avec un dataset sur lequel travailler — le skill est un guide que l'agent suit, pas un logiciel à installer
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor — le skill de bonnes pratiques scikit-learn de @mindrally : la discipline complète d'un workflow ML solide — splitter avant tout prétraitement (stratifié pour classes déséquilibrées), toujours chaîner prétraitement et modélisation dans `Pipeline`/`ColumnTransformer` pour que les transformers ne soient fit que sur le train, scaler selon l'algorithme (StandardScaler/MinMaxScaler/RobustScaler), encoder les catégorielles, imputer les valeurs manquantes, valider croisé avec la bonne stratégie (`KFold`, `StratifiedKFold`, `TimeSeriesSplit`, `GroupKFold`), tuner avec `GridSearchCV`/`RandomizedSearchCV` sur train/val seulement avec `n_jobs=-1`, évaluer avec des métriques adaptées au problème (F1/ROC-AUC pour le déséquilibre, MAE/R² pour la régression), rapporter des intervalles de confiance contre des baselines significatives, évaluer sur le test tenu à l'écart une seule fois à la fin, persister des pipelines entiers avec joblib, et versionner les artefacts de modèles. Bémols honnêtes : méthodologie seulement — l'agent a besoin d'un dataset ML et d'un environnement Python ; certaines règles (p. ex. `class_weight='balanced'`) sont spécifiques à scikit-learn. Licence Apache-2.0. Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage. Découvert via skills.sh.
Version :
Installation
Prérequis : un projet ML Python avec un dataset sur lequel travailler — le skill est un guide que l'agent suit, pas un logiciel à installer Installe-moi « Bonnes pratiques scikit-learn : pipelines sans fuite, CV, tuning et évaluation ». Il donne à mon agent le manuel scikit-learn de @mindrally : discipline split-avant-prétraitement, Pipeline/ColumnTransformer contre les fuites de données, scaling et encodage par algorithme, bonne stratégie de validation croisée par type de problème, tuning GridSearchCV/RandomizedSearchCV, métriques adaptées au problème (F1/ROC-AUC pour le déséquilibre, MAE/R2 pour la régression), évaluation finale unique sur test tenu à l'écart, et persistance joblib avec artefacts versionnés. Licence Apache-2.0. Dépôt : https://github.com/mindrally/skills/blob/main/scikit-learn-best-practices/SKILL.md 1. Récupère le fichier SKILL.md (et les fichiers d'aide éventuels) depuis le chemin du dépôt dans un dossier temporaire et résume en une ou deux phrases ce qu'il fait. 2. Vérification de sécurité : examine le SKILL.md et les scripts pour tout contenu suspect (appels réseau inattendus, commandes shell, collecte d'identifiants). Ce dépôt ne devrait contenir aucun secret en dur, les identifiants uniquement via le coffre sécurisé, les hôtes autorisés déclarés dans le SKILL.md. Vérifie que c'est bien le cas ici ; STOP sur tout signal d'alerte et dis-le-moi. 3. Installe-le comme skill : copie le SKILL.md et ses fichiers d'aide dans le répertoire des skills de l'agent, dans un dossier nommé « scikit-learn-best-practices ». 4. Vérifie sans appels réseau : frontmatter valide, fichiers en place. 5. Indique ce qui a été installé, où, et ce qu'il me reste à faire moi-même (p. ex. pointer l'agent vers mon dataset et le modèle à entraîner ou réviser ; rien d'autre — c'est une méthodologie). GitHub est optionnel : si j'ai un compte GitHub ou la CLI gh, tu peux l'utiliser ; sinon l'accès public suffit. Ne jamais l'exiger sauf s'il figure dans les prérequis ci-dessus. Règles : ne touche à rien en dehors du dossier temporaire et de la cible d'installation. Si quelque chose semble anormal, arrête-toi et demande-moi.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.