Knowledge distillation for LLMs: compress teachers into small capable students
Temperature scaling et soft targets, KLD forward vs reverse (MiniLLM), distillation de logits et de réponses, setups multi-teachers, et script d'entraînement de production avec règles empiriques d'hyperparamètres
- Quoi
- Temperature scaling et soft targets, KLD forward vs reverse (MiniLLM), distillation de logits et de réponses, setups multi-teachers, et script d'entraînement de production avec règles empiriques d'hyperparamètres
- Coût
- Gratuit
- Prérequis
- Python avec PyTorch et transformers, compute GPU pour l'entraînement, et accès à un modèle teacher à distiller (vérifier les conditions d'utilisation du teacher avant de distiller depuis des modèles propriétaires)
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor — le skill knowledge-distillation de @orchestra-research : le workflow complet pour compresser de gros LLM en petits modèles déployables — temperature scaling (T=2-5 standard), combinaison de loss soft vs hard (pondération alpha), divergence KL forward vs reverse (le reverse KLD de MiniLLM pour une qualité générative couvrant les modes), distillation de logits (variantes directe et MSE), distillation de réponses (entraîner sur données synthétiques générées par le teacher), stratégies two-stage et multi-teachers, une boucle d'entraînement de distillation basique prête à adapter, un `DistillationTrainer` de production (sous-classe du Trainer transformers avec loss de distillation), règles d'hyperparamètres (ratios de taille : 10x excellent comme 70B→7B, éviter les écarts de 70x), guidance de qualité de données (70 % généré par le teacher + 30 % réel), et un pattern d'évaluation comparant sorties teacher vs student. Références de papers : Hinton et al. 2015, MiniLLM, le survey KD 2024. Bémols honnêtes : l'affirmation phare (70B→7B conservant 90 %+ de performance) est celle du skill — les résultats réels varient selon tâche et données ; distiller depuis des modèles propriétaires (GPT-4) soulève des questions de conditions d'utilisation et de licence — vérifier les conditions du teacher avant de distiller ; nécessite un compute GPU substantiel pour l'entraînement. Licence MIT. Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage. Découvert via skills.sh.
Version :
Installation
Prérequis : Python avec PyTorch et transformers, compute GPU pour l'entraînement, et accès à un modèle teacher à distiller (vérifier les conditions d'utilisation du teacher avant de distiller depuis des modèles propriétaires) Installe-moi « Distillation de connaissances pour LLM : compresser les teachers en petits students capables ». Il donne à mon agent le manuel de distillation de @orchestra-research : temperature scaling et combinaison de loss soft/hard, KLD forward vs reverse (MiniLLM), distillation de logits et de réponses, stratégies multi-teachers et two-stage, un DistillationTrainer de production, règles empiriques d'hyperparamètres, et un pattern d'évaluation teacher-vs-student. Licence MIT. Dépôt : https://github.com/orchestra-research/ai-research-skills/blob/main/19-emerging-techniques/knowledge-distillation/SKILL.md 1. Récupère le fichier SKILL.md (et les fichiers d'aide éventuels) depuis le chemin du dépôt dans un dossier temporaire et résume en une ou deux phrases ce qu'il fait. 2. Vérification de sécurité : examine le SKILL.md et les scripts pour tout contenu suspect (appels réseau inattendus, commandes shell, collecte d'identifiants). Ce dépôt ne devrait contenir aucun secret en dur, les identifiants uniquement via le coffre sécurisé, les hôtes autorisés déclarés dans le SKILL.md. Vérifie que c'est bien le cas ici ; STOP sur tout signal d'alerte et dis-le-moi. 3. Installe-le comme skill : copie le SKILL.md et ses fichiers d'aide dans le répertoire des skills de l'agent, dans un dossier nommé « knowledge-distillation ». 4. Vérifie sans appels réseau : frontmatter valide, fichiers en place. 5. Indique ce qui a été installé, où, et ce qu'il me reste à faire moi-même (p. ex. confirmer le compute GPU et choisir la paire teacher/student plus le mix de données (généré par le teacher + réel) ; vérifier que les conditions du teacher autorisent la distillation ; valider les affirmations de compression sur mon propre jeu d'évaluation). GitHub est optionnel : si j'ai un compte GitHub ou la CLI gh, tu peux l'utiliser ; sinon l'accès public suffit. Ne jamais l'exiger sauf s'il figure dans les prérequis ci-dessus. Règles : ne touche à rien en dehors du dossier temporaire et de la cible d'installation. Si quelque chose semble anormal, arrête-toi et demande-moi.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.