Muse Glimmer on one Arc Pro B70
Recette vLLM-XPU + DFlash : Muse Glimmer 30B à ~90 tok/s sur une Intel Arc Pro B70 ; benchmarks complets.
- Quoi
- Recette vLLM-XPU + DFlash : Muse Glimmer 30B à ~90 tok/s sur une Intel Arc Pro B70 ; benchmarks complets.
- Coût
- Gratuit
- Prérequis
- Reproduisez la recette Muse Glimmer B70.
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor : une recette de recherche et une suite de benchmarks qui font tourner Muse Glimmer 30B de Meta sur une seule Intel Arc Pro B70 (32 Go), bien au-dessus de la référence publique. En passant de llama.cpp à vLLM-XPU avec une cible GPTQ 4-bit, des graphes XPU et un draft DFlash quantifié (20 jetons spéculatifs), l'auteur documente 89-101 jetons/s en décodage glouton mono-flux sur des charges qui terminent leurs réponses (GSM8K, HumanEval) contre environ 27-32 jetons/s pour les recettes llama.cpp publiées, plus un profil de contexte natif de 131k jetons et un balayage de concurrence (840 jetons/s agrégés à C96 en rafale). Chaque chiffre est livré avec son protocole de reproduction, ses scripts, ses sommes de contrôle et ses limites déclarées. Par @mgaruccio (Mike Garuccio), listé ici avec crédit à son créateur. Bémols honnêtes : c'est un profil de recherche, pas une garantie de sécurité en production ; un test forcé de six requêtes proches de la capacité a produit deux réponses vides et cet échec reste non résolu ; il faut exactement ce matériel (une Arc Pro B70, Linux avec le pilote xe, Docker, /dev/dri), ce n'est pas du CUDA. Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage.
Version :
Installation
Copiez le dossier d’installation ci-dessous, puis collez-le dans MuseCréation de la communauté. Skill Harbor ne vérifie pas le code — examinez la source avant de l'installer.
Reproduisez la recette Muse Glimmer B70. Prérequis : UNE Intel Arc Pro B70 (32 Go) ; Linux avec le pilote xe ; Docker ; /dev/dri disponible. Ce n'est pas du CUDA. 1. Téléchargez les poids : `hf download mgaruccio/Muse-Glimmer-30B-GPTQ-Int4-sym-G128 --local-dir ./models/target` et `hf download mgaruccio/Muse-Glimmer-30B-assistant-GPTQ-Int4-sym-G128 --local-dir ./models/draft`, puis comparez les hachages des shards avec docs/checksums.md du dépôt. 2. `export MODEL="$PWD/models/target"`, `export DRAFT="$PWD/models/draft"`, `export DFLASH_KV_MODE=none`. 3. Lancez : `bash scripts/start-muse-vllm-dflash-c1-graph-draft-gptq.sh`, puis `bash scripts/wait-vllm-health.sh 420 8000`. 4. Vérifiez : `curl -sf http://127.0.0.1:8000/v1/models` (attendez l'id servi muse-glimmer-gptq). 5. Mesurez : `python3 scripts/vllm-dflash-share-suite.py 3 2048 share-suite.json` ; le processus sort en non-zéro sur tout prompt non citable, alors ne publiez pas de titre depuis une exécution partielle. Note : Muse streame delta.reasoning puis delta.content, donc un client qui ne lit que content semble inactif jusqu'à la fin de la réflexion. Voir docs/concurrency.md pour le profil multi-client C8/K4, et docs/share-suite.md pour le protocole de mesure.
Enregistré dans vos installs récentes. Retrouvez-le à tout moment sur /connect.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.