GPTQ post-training 4-bit quantization for LLMs: fit big models on small GPUs
Quantification 4 bits par groupes avec ~2 % de perte de perplexité, 4x moins de mémoire et 3-4x d'inférence plus rapide, backends de kernels (ExLlamaV2, Marlin, Triton), intégration transformers/QLoRA et tables de benchmarks
- Quoi
- Quantification 4 bits par groupes avec ~2 % de perte de perplexité, 4x moins de mémoire et 3-4x d'inférence plus rapide, backends de kernels (ExLlamaV2, Marlin, Triton), intégration transformers/QLoRA et tables de benchmarks
- Coût
- Gratuit
- Prérequis
- Python avec pip et un GPU CUDA pour la vraie quantification (CPU seul suffit pour lire le workflow, pas pour quantifier) ; accès HuggingFace pour les modèles pré-quantifiés
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor — le skill GPTQ de @orchestra-research : le workflow complet de quantification post-entraînement 4 bits pour LLM — comment fonctionne la quantification par groupes (scale/zero-point par groupe, minimisation d'erreur sensible au Hessien), la table d'arbitrage de taille de groupe (32/128/256/1024 avec guidance mémoire, précision et vitesse — 128 est le défaut recommandé), trois configs prêtes (4 bits standard, 3 bits haute précision, 4 bits précision max avec petits groupes), backends de kernels (ExLlamaV2 par défaut, Marlin pour GPU Ampere+, Triton pour Linux), install et usage d'auto-gptq, chargement de modèles pré-quantifiés depuis HuggingFace (les 1000+ modèles GPTQ de TheBloke), quantification de son propre modèle avec données de calibration, intégration transformers, fine-tuning QLoRA sur base GPTQ (un modèle 70B entraînable sur un seul A100 80GB), patterns de déploiement multi-GPU et offloading CPU, et tables de benchmarks (4x de mémoire en moins — Llama 2-70B 140GB → 35GB ; 3,4-4,8x de vitesse d'inférence ; <2 % de dégradation de perplexité). Bémols honnêtes : guidance plus librairies pip-installables — nécessite des GPU CUDA pour la vraie quantification ; quand préférer AWQ ou bitsandbytes est couvert honnêtement (meilleure précision sur Ampere/Ada, intégration 8 bits plus simple) ; les affirmations de performance sont celles du skill, à valider sur votre propre matériel. Licence MIT. Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage. Découvert via skills.sh.
Version :
Installation
Prérequis : Python avec pip et un GPU CUDA pour la vraie quantification (CPU seul suffit pour lire le workflow, pas pour quantifier) ; accès HuggingFace pour les modèles pré-quantifiés Installe-moi « Quantification GPTQ 4 bits post-entraînement pour LLM : faire tenir de gros modèles sur de petits GPU ». Il donne à mon agent le manuel GPTQ de @orchestra-research : configs de quantification 4 bits par groupes (standard, 3 bits haute précision, petits groupes précision max), backends de kernels (ExLlamaV2, Marlin, Triton), install d'auto-gptq, chargement de modèles pré-quantifiés, quantification de son propre modèle avec données de calibration, intégration transformers/QLoRA, patterns de déploiement multi-GPU et offloading CPU, et tables de benchmarks. Licence MIT. Dépôt : https://github.com/orchestra-research/ai-research-skills/blob/main/10-optimization/gptq/SKILL.md 1. Récupère le fichier SKILL.md (et les fichiers d'aide éventuels) depuis le chemin du dépôt dans un dossier temporaire et résume en une ou deux phrases ce qu'il fait. 2. Vérification de sécurité : examine le SKILL.md et les scripts pour tout contenu suspect (appels réseau inattendus, commandes shell, collecte d'identifiants). Ce dépôt ne devrait contenir aucun secret en dur, les identifiants uniquement via le coffre sécurisé, les hôtes autorisés déclarés dans le SKILL.md. Vérifie que c'est bien le cas ici ; STOP sur tout signal d'alerte et dis-le-moi. 3. Installe-le comme skill : copie le SKILL.md et ses fichiers d'aide dans le répertoire des skills de l'agent, dans un dossier nommé « gptq ». 4. Vérifie sans appels réseau : frontmatter valide, fichiers en place. 5. Indique ce qui a été installé, où, et ce qu'il me reste à faire moi-même (p. ex. confirmer qu'un GPU CUDA est disponible et quel chemin prendre — charger un modèle pré-quantifié depuis HuggingFace ou quantifier mon propre modèle avec données de calibration ; valider les affirmations de benchmarks sur mon propre matériel ; choisir le backend de kernel pour ma génération de GPU — Marlin exige Ampere+). GitHub est optionnel : si j'ai un compte GitHub ou la CLI gh, tu peux l'utiliser ; sinon l'accès public suffit. Ne jamais l'exiger sauf s'il figure dans les prérequis ci-dessus. Règles : ne touche à rien en dehors du dossier temporaire et de la cible d'installation. Si quelque chose semble anormal, arrête-toi et demande-moi.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.