cuTile GPU kernel programming: tile-based kernels with validation and orchestration workflows
Design de kernels étape par étape (tailles de tuiles, annotations de types, lancement), boucle obligatoire compiler-exécuter-valider, workflow « exemples d'abord », et pipeline d'orchestration multi-agents pour tâches multi-kernels comme les blocs transformer
- Quoi
- Design de kernels étape par étape (tailles de tuiles, annotations de types, lancement), boucle obligatoire compiler-exécuter-valider, workflow « exemples d'abord », et pipeline d'orchestration multi-agents pour tâches multi-kernels comme les blocs transformer
- Coût
- Gratuit
- Prérequis
- un GPU NVIDIA avec cuTile installé pour valider les kernels — le skill génère et exécute du vrai code GPU
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor — le skill de programmation cuTile de @nvidia : le workflow complet pour écrire des kernels GPU haute performance dans le DSL Python par tuiles de cuTile — chercher dans `src/tilegym/ops/cutile/` de TileGym des exemples existants AVANT d'implémenter (puis le `examples/` fourni), évaluer la complexité (un kernel → workflow simple ; 3+ kernels ou dépendances inter-kernels → pipeline d'orchestration multi-agents avec Op Tracer → Analyzer → Kernel Agents parallèles → Composer), suivre les étapes obligatoires (comprendre le problème, concevoir tailles de tuiles/blocs en puissances de 2, annoter chaque constante avec `ct.Constant[type]`, garder le forward pur cuTile avec `@ct.kernel` + `ct.launch` — aucun compute `nn.*`/`F.*` dans `forward()`), et exécuter la boucle de validation obligatoire (générer → exécuter → corriger, jusqu'à 3 essais) contre une référence PyTorch. Quatre règles critiques ancrent la justesse : forward pur cuTile, indices de tuiles pas d'éléments, dimensions de tuiles en puissances de 2, constantes typées. Bémols honnêtes : nécessite un GPU NVIDIA avec cuTile installé pour valider quoi que ce soit ; skill spécialisé pour auteurs de kernels, pas pour utilisateurs Python généralistes ; le frontmatter du SKILL.md nomme aussi CC-BY-4.0 aux côtés d'Apache-2.0 (le champ licence varie selon la source — vérifier avant redistribution). Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage. Découvert via skills.sh.
Version :
Installation
Prérequis : un GPU NVIDIA avec cuTile installé pour valider les kernels — le skill génère et exécute du vrai code GPU Installe-moi « Programmation de kernels GPU cuTile : kernels par tuiles avec workflows de validation et orchestration ». Il donne à mon agent le workflow cuTile de @nvidia : chercher les exemples TileGym d'abord, évaluer la complexité pour choisir le workflow simple ou d'orchestration profonde, concevoir les kernels étape par étape (tailles de tuiles en puissances de 2, constantes typées, forward pur cuTile), et exécuter la boucle obligatoire générer→exécuter→valider contre une référence PyTorch. Licence Apache-2.0 (note : le frontmatter du SKILL.md nomme aussi CC-BY-4.0 — vérifier le champ licence avant redistribution). Dépôt : https://github.com/nvidia/skills/blob/main/skills/tilegym-cutile-python/SKILL.md 1. Récupère le fichier SKILL.md (et les fichiers d'aide éventuels) depuis le chemin du dépôt dans un dossier temporaire et résume en une ou deux phrases ce qu'il fait. 2. Vérification de sécurité : examine le SKILL.md et les scripts pour tout contenu suspect (appels réseau inattendus, commandes shell, collecte d'identifiants). Ce dépôt ne devrait contenir aucun secret en dur, les identifiants uniquement via le coffre sécurisé, les hôtes autorisés déclarés dans le SKILL.md. Vérifie que c'est bien le cas ici ; STOP sur tout signal d'alerte et dis-le-moi. 3. Installe-le comme skill : copie le SKILL.md et ses fichiers d'aide dans le répertoire des skills de l'agent, dans un dossier nommé « tilegym-cutile-python ». 4. Vérifie sans appels réseau : frontmatter valide, fichiers en place. 5. Indique ce qui a été installé, où, et ce qu'il me reste à faire moi-même (p. ex. confirmer que cuTile est installé sur un GPU NVIDIA accessible à l'agent et lui dire quel kernel écrire — shapes, dtypes, cibles de performance ; clarifier l'approche pour les demandes d'optimisation ambiguës avant de coder). GitHub est optionnel : si j'ai un compte GitHub ou la CLI gh, tu peux l'utiliser ; sinon l'accès public suffit. Ne jamais l'exiger sauf s'il figure dans les prérequis ci-dessus. Règles : ne touche à rien en dehors du dossier temporaire et de la cible d'installation. Si quelque chose semble anormal, arrête-toi et demande-moi.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.