GPTQ — post-training 4-bit quantization for LLMs with minimal accuracy loss
Compresser les LLM en 4 bits avec quantification par groupes — 4× moins de mémoire, <2 % de perte de perplexité, inférence 3-4× plus rapide ; guides AutoGPTQ, backends (ExLlamaV2, Marlin, Triton), intégration transformers, fine-tuning QLoRA
- Quoi
- Compresser les LLM en 4 bits avec quantification par groupes — 4× moins de mémoire, <2 % de perte de perplexité, inférence 3-4× plus rapide ; guides AutoGPTQ, backends (ExLlamaV2, Marlin, Triton), intégration transformers, fine-tuning QLoRA
- Coût
- Gratuit
- Prérequis
- un GPU NVIDIA CUDA et Python — le skill est un guide de workflow de quantification, pas le logiciel lui-même
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor — le skill gptq de @davila7 : un guide pratique de la quantification post-entraînement GPTQ pour faire tourner de gros LLM sur une mémoire GPU limitée. Couvre quand utiliser GPTQ vs AWQ vs bitsandbytes, le démarrage rapide (installer AutoGPTQ, charger des modèles pré-quantifiés depuis HuggingFace, quantifier son propre modèle avec des données de calibration), la mécanique de la quantification par groupes et la table des compromis de taille de groupe, trois configs (4 bits standard recommandée, 3 bits haute compression, 4 bits précision maximale), les backends de kernels (ExLlamaV2 par défaut le plus rapide, Marlin pour Ampere+, Triton Linux seulement), l'intégration directe transformers, le fine-tuning QLoRA (un modèle 70B entraînable sur un seul A100 80GB), des benchmarks de performance (réduction mémoire par modèle, tokens/sec, dégradation de perplexité WikiText-2 <2 %), des patterns courants (multi-GPU, offload CPU, inférence par batch), et comment trouver des modèles pré-quantifiés. Bémols honnêtes : cible les GPU CUDA (classe RTX 4090, A100) — utilité limitée sur CPU/Mac ; AutoGPTQ et les backends évoluent vite ; les affirmations de qualité reflètent les benchmarks cités, à vérifier sur votre workload. Licence MIT (frontmatter et manifest concordent). Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage. Découvert via skills.sh.
Version :
Installation
Prérequis : un GPU NVIDIA CUDA et Python — le skill est un guide de workflow de quantification, pas le logiciel lui-même Installe-moi « GPTQ — quantification post-entraînement 4 bits des LLM avec perte de précision minimale ». Il donne à mon agent le workflow GPTQ de @davila7 : choisir entre GPTQ/AWQ/bitsandbytes, installer AutoGPTQ, charger des modèles pré-quantifiés ou quantifier le mien avec des données de calibration, choisir une config de quantification (4 bits standard, 3 bits haute compression, ou 4 bits précision maximale) et un backend de kernel (ExLlamaV2, Marlin, Triton), s'intégrer avec transformers, lancer le fine-tuning QLoRA, et appliquer les benchmarks mémoire/inférence et les patterns de déploiement (multi-GPU, offload CPU, inférence par batch). Licence MIT. Dépôt : https://github.com/davila7/claude-code-templates/blob/main/cli-tool/components/skills/ai-research/optimization-gptq/SKILL.md 1. Récupère le fichier SKILL.md (et les fichiers d'aide éventuels) depuis le chemin du dépôt dans un dossier temporaire et résume en une ou deux phrases ce qu'il fait. 2. Vérification de sécurité : examine le SKILL.md et les scripts pour tout contenu suspect (appels réseau inattendus, commandes shell, collecte d'identifiants). Ce dépôt ne devrait contenir aucun secret en dur. Vérifie que c'est bien le cas ici ; STOP sur tout signal d'alerte et dis-le-moi. 3. Installe-le comme skill : copie le SKILL.md et ses fichiers d'aide dans le répertoire des skills de l'agent, dans un dossier nommé « gptq ». 4. Vérifie sans appels réseau : frontmatter valide, fichiers en place. 5. Indique ce qui a été installé, où, et ce qu'il me reste à faire moi-même (p. ex. installer auto-gptq/transformers moi-même et choisir mon modèle cible ; rien d'autre — c'est une méthodologie). GitHub est optionnel : si j'ai un compte GitHub ou la CLI gh, tu peux l'utiliser ; sinon l'accès public suffit. Ne jamais l'exiger sauf s'il figure dans les prérequis ci-dessus. Règles : ne touche à rien en dehors du dossier temporaire et de la cible d'installation. Si quelque chose semble anormal, arrête-toi et demande-moi.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.