Megatron Bridge GPU memory tuning: OOM fixes, fragmentation and PEFT tricks
Réduire le pic de mémoire GPU en entraînement Megatron Bridge — segments extensibles, re-gather d'entrées PEFT, redimensionnement du parallélisme, recompute d'activations, résultats mesurés sur Llama3 70B
- Quoi
- Réduire le pic de mémoire GPU en entraînement Megatron Bridge — segments extensibles, re-gather d'entrées PEFT, redimensionnement du parallélisme, recompute d'activations, résultats mesurés sur Llama3 70B
- Coût
- Gratuit
- Prérequis
- un setup d'entraînement distribué NVIDIA Megatron Bridge / NeMo sur matériel multi-GPU — le skill est une méthodologie que l'agent suit, pas un logiciel à installer
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor — le skill de tuning mémoire GPU de @nvidia pour Megatron Bridge : un manuel décisionnel pour les OOM d'entraînement, partant du constat que la plupart des OOM viennent de la fragmentation mémoire, pas du manque de capacité brute. Le correctif unique le plus efficace : `PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True` (zéro coût de throughput). Puis, dans l'ordre : pour LoRA avec parallélisme de séquence, activer `sequence_parallel_input_regather` pour ne plus retenir les entrées LoRA-A gathered complètes ; ajouter du recompute d'activations sélectif (`recompute_modules=[core_attn]`) avec son coût d'environ 16 % d'utilisation ; redimensionner le parallélisme (avec avertissements — doubler TP coûte -28 % de throughput sur Llama3 70B, monter PP coûte ~6 % et le CPU offloading est bloqué quand PP > 1) ; le skill inclut des comparaisons de stratégies mesurées sur Llama3 70B SFT (32x H100 80GB), des résultats de re-gather d'entrées PEFT+SP (Qwen3-8B, Qwen3-30B-A3B, GPT-OSS-120B), des contraintes de compatibilité (segments extensibles incompatibles avec `--use-nccl-ub`, règles de CUDA graphs), des ancres de code, une table de diagnostic d'échecs et une procédure de vérification avec commandes pytest. Bémols honnêtes : profondément spécialisé — entraînement distribué NVIDIA Megatron Bridge / NeMo sur clusters multi-GPU uniquement, pas pour l'entraînement hobby mono-GPU ; renvoie à des skills compagnons (recompute d'activations, FSDP) et des docs du même repo non fournis ici. Licence Apache-2.0. Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage. Découvert via skills.sh.
Version :
Installation
Prérequis : un setup d'entraînement distribué NVIDIA Megatron Bridge / NeMo sur matériel multi-GPU — le skill est une méthodologie que l'agent suit, pas un logiciel à installer Installe-moi « Tuning mémoire GPU pour Megatron Bridge : corrections d'OOM, fragmentation et astuces PEFT ». Il donne à mon agent le manuel mémoire GPU de @nvidia pour Megatron Bridge : l'ordre de décision pour les OOM d'entraînement (segments extensibles d'abord, puis re-gather d'entrées PEFT pour LoRA+SP, recompute d'activations sélectif, redimensionnement du parallélisme avec tradeoffs mesurés), les contraintes de compatibilité, les ancres de code, une table de diagnostic d'échecs et des procédures de vérification. Licence Apache-2.0. Dépôt : https://github.com/nvidia/skills/blob/main/skills/nemo-mbridge-perf-memory-tuning/SKILL.md 1. Récupère le fichier SKILL.md (et les fichiers d'aide éventuels) depuis le chemin du dépôt dans un dossier temporaire et résume en une ou deux phrases ce qu'il fait. 2. Vérification de sécurité : examine le SKILL.md et les scripts pour tout contenu suspect (appels réseau inattendus, commandes shell, collecte d'identifiants). Examine les fichiers à la recherche de commandes suspectes ou d'une gestion d'identifiants douteuse ; arrête-toi sur tout signal d'alerte et ne présume jamais que le dépôt est sûr. Dis-le-moi si quelque chose semble anormal. 3. Installe-le comme skill : copie le SKILL.md et ses fichiers d'aide dans le répertoire des skills de l'agent, dans un dossier nommé « nemo-mbridge-perf-memory-tuning ». 4. Vérifie sans appels réseau : frontmatter valide, fichiers en place. 5. Indique ce qui a été installé, où, et ce qu'il me reste à faire moi-même (p. ex. remettre à l'agent votre config d'entraînement Megatron Bridge et vos symptômes d'OOM ; noter que les skills compagnons activation-recompute et megatron-fsdp sont référencés mais non fournis ici). GitHub est optionnel : si j'ai un compte GitHub ou la CLI gh, tu peux l'utiliser ; sinon l'accès public suffit. Ne jamais l'exiger sauf s'il figure dans les prérequis ci-dessus. Règles : ne touche à rien en dehors du dossier temporaire et de la cible d'installation. Si quelque chose semble anormal, arrête-toi et demande-moi.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.