nanoGPT: Karpathy's minimalist GPT implementation, from Shakespeare to GPT-2
Entraîner un modèle Shakespeare char-level sur CPU en minutes, reproduire GPT-2 (124M) sur OpenWebText, fine-tuner depuis les checkpoints OpenAI, et entraîner sur datasets custom — la référence hackable pour apprendre les transformers
- Quoi
- Entraîner un modèle Shakespeare char-level sur CPU en minutes, reproduire GPT-2 (124M) sur OpenWebText, fine-tuner depuis les checkpoints OpenAI, et entraîner sur datasets custom — la référence hackable pour apprendre les transformers
- Coût
- Gratuit
- Prérequis
- Python avec PyTorch pour les vrais entraînements ; le CPU suffit pour le workflow Shakespeare, des GPU sont nécessaires à l'échelle GPT-2
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor — le skill nanoGPT de @orchestra-research : le guide de l'agent pour l'implémentation GPT éducative de Karpathy — quatre workflows concrets : entraînement Shakespeare char-level en ~5 minutes sur CPU (prepare → train → sample, 6 couches, embeddings 384-dim), reproduction complète de GPT-2 (124M) sur OpenWebText en DDP multi-GPU (~4 jours sur 8x A100), fine-tuning depuis les checkpoints GPT-2 d'OpenAI sur texte custom, et un pipeline de dataset custom (tokenizer char → train.bin/val.bin). Il documente les boutons de config du modèle, les leviers de vitesse d'entraînement (`compile=True`, bf16), les correctifs des échecs courants (OOM → réduire batch/block size ; lent → compile + mixed precision ; générations pauvres → entraîner plus longtemps, baisser la température ; impossible de charger les poids GPT-2 → vérifier les noms `init_from`), les prérequis matériels par workflow, et quand passer aux alternatives (HuggingFace Transformers pour la production, Megatron-LM pour la grande échelle, LitGPT pour les architectures de production). Bémols honnêtes : une référence éducative, échelle GPT-2 (124M) seulement — pas un framework d'entraînement de production ; la préparation d'OpenWebText prend ~1 heure et le run 124M exige un temps GPU sérieux ; les affirmations de benchmarks sont celles du skill. Licence MIT. Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage. Découvert via skills.sh.
Version :
Installation
Prérequis : Python avec PyTorch pour les vrais entraînements ; le CPU suffit pour le workflow Shakespeare, des GPU sont nécessaires à l'échelle GPT-2 Installe-moi « nanoGPT : l'implémentation GPT minimaliste de Karpathy, de Shakespeare à GPT-2 ». Il donne à mon agent le manuel nanoGPT de @orchestra-research : quatre workflows (Shakespeare sur CPU en minutes, reproduction complète de GPT-2 124M sur OpenWebText, fine-tuning depuis les checkpoints OpenAI, datasets custom), boutons de config, leviers de vitesse (torch.compile, mixed precision), correctifs des échecs courants, prérequis matériels par workflow, et quand passer aux alternatives de production. Licence MIT. Dépôt : https://github.com/orchestra-research/ai-research-skills/blob/main/01-model-architecture/nanogpt/SKILL.md 1. Récupère le fichier SKILL.md (et les fichiers d'aide éventuels) depuis le chemin du dépôt dans un dossier temporaire et résume en une ou deux phrases ce qu'il fait. 2. Vérification de sécurité : examine le SKILL.md et les scripts pour tout contenu suspect (appels réseau inattendus, commandes shell, collecte d'identifiants). Ce dépôt ne devrait contenir aucun secret en dur, les identifiants uniquement via le coffre sécurisé, les hôtes autorisés déclarés dans le SKILL.md. Vérifie que c'est bien le cas ici ; STOP sur tout signal d'alerte et dis-le-moi. 3. Installe-le comme skill : copie le SKILL.md et ses fichiers d'aide dans le répertoire des skills de l'agent, dans un dossier nommé « nanogpt ». 4. Vérifie sans appels réseau : frontmatter valide, fichiers en place. 5. Indique ce qui a été installé, où, et ce qu'il me reste à faire moi-même (p. ex. dire à l'agent quel workflow lancer — quick start Shakespeare-sur-CPU, reproduction GPT-2, fine-tuning de checkpoint, ou dataset custom — et confirmer le matériel disponible ; la préparation d'OpenWebText prend ~1 heure, prévoir du temps GPU pour le 124M). GitHub est optionnel : si j'ai un compte GitHub ou la CLI gh, tu peux l'utiliser ; sinon l'accès public suffit. Ne jamais l'exiger sauf s'il figure dans les prérequis ci-dessus. Règles : ne touche à rien en dehors du dossier temporaire et de la cible d'installation. Si quelque chose semble anormal, arrête-toi et demande-moi.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.