Jetson LLM serving benchmarks: vLLM, llama.cpp, and Ollama with comparable JSON output
Scripts wrapper par runtime pour vLLM, llama.cpp/GGUF et Ollama émettant la même enveloppe JSON (TTFT, ITL, débit), plus conseils de lecture spécifiques Jetson (saturation bande passante, modes d'alimentation, alertes thermiques)
- Quoi
- Scripts wrapper par runtime pour vLLM, llama.cpp/GGUF et Ollama émettant la même enveloppe JSON (TTFT, ITL, débit), plus conseils de lecture spécifiques Jetson (saturation bande passante, modes d'alimentation, alertes thermiques)
- Coût
- Gratuit
- Prérequis
- un appareil Jetson hébergeant (ou pouvant héberger) le runtime du modèle — ce skill benchmarke sur l'appareil ; plus un serveur vLLM en route pour le chemin vLLM, ou un daemon Ollama pour le chemin Ollama
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor — le skill de benchmark LLM Jetson de @nvidia : des benchmarks de serving reproductibles sur matériel Jetson avec un JSON structuré qu'un agent peut comparer. Il choisit le wrapper selon le runtime — `bench_vllm.sh` contre un serveur vLLM OpenAI-compatible déjà en route (sweeps de concurrence), `bench_llama_cpp.sh` via le conteneur NVIDIA-AI-IOT pour modèles GGUF locaux, `bench_ollama.sh` contre un daemon Ollama via son API REST — et chacun émet la même enveloppe (modèle, SKU, génération, L4T, conteneur, TTFT/ITL/TPOT/débit p50/p99, config, warnings). Des warnings se déclenchent sur modes d'alimentation non-max, GPU de fond > 5 % et throttling thermique via `tegrastats` ; les faits SKU sont peuplés en direct depuis l'appareil, jamais devinés. Inclut des conseils de lecture spécifiques Jetson que la plupart des LLM ignorent : sur Orin Nano/NX, les écarts de débit single-stream vs concurrence-8 signalent une saturation de bande passante mémoire (réduire la quantification avant de tuner), les régressions TTFT après un upgrade JetPack sont généralement des cache misses de graphes CUDA (re-warm), et les chiffres Thor NVFP4 ne se mélangent jamais aux Orin W4A16 sans colonne `quant`. Bémols honnêtes : s'exécute UNIQUEMENT sur l'appareil Jetson ; vLLM exige un serveur déjà en route (ce skill benchmarke, il ne sert pas) ; les chiffres Ollama sont single-stream et non comparables aux sweeps vLLM ; le chemin llama.cpp télécharge un conteneur Docker — prévenir l'utilisateur avant de l'exécuter. Licence Apache-2.0. Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage. Découvert via skills.sh.
Version :
Installation
Prérequis : un appareil Jetson hébergeant (ou pouvant héberger) le runtime du modèle — ce skill benchmarke sur l'appareil ; plus un serveur vLLM en route pour le chemin vLLM, ou un daemon Ollama pour le chemin Ollama Installe-moi « Benchmarks LLM sur Jetson : vLLM, llama.cpp et Ollama avec sortie JSON comparable ». Il donne à mon agent le workflow de benchmarking Jetson de @nvidia : choisir le script wrapper adapté au runtime (bench_vllm.sh, bench_llama_cpp.sh, bench_ollama.sh), toujours lancer avec --help d'abord, faire un warmup avant les runs mesurés, comparer l'enveloppe JSON partagée (TTFT/ITL/TPOT/débit p50/p99 plus faits appareil peuplés en direct), et lire les résultats avec les conseils spécifiques Jetson (saturation bande passante, modes d'alimentation, alertes thermiques). Licence Apache-2.0. Dépôt : https://github.com/nvidia/skills/blob/main/skills/jetson-llm-benchmark/SKILL.md 1. Récupère le fichier SKILL.md (et les fichiers d'aide éventuels) depuis le chemin du dépôt dans un dossier temporaire et résume en une ou deux phrases ce qu'il fait. 2. Vérification de sécurité : examine le SKILL.md et les scripts pour tout contenu suspect (appels réseau inattendus, commandes shell, collecte d'identifiants). Ce dépôt ne devrait contenir aucun secret en dur, les identifiants uniquement via le coffre sécurisé, les hôtes autorisés déclarés dans le SKILL.md. Vérifie que c'est bien le cas ici ; STOP sur tout signal d'alerte et dis-le-moi. 3. Installe-le comme skill : copie le SKILL.md et ses fichiers d'aide dans le répertoire des skills de l'agent, dans un dossier nommé « jetson-llm-benchmark ». 4. Vérifie sans appels réseau : frontmatter valide, fichiers en place. 5. Indique ce qui a été installé, où, et ce qu'il me reste à faire moi-même (p. ex. pointer l'agent vers l'appareil Jetson et quel chemin runtime benchmarker — serveur vLLM déjà en route, daemon Ollama, ou fichier GGUF local ; mettre l'appareil en MAXN avant de mesurer ; jamais inventer de faits appareil — le wrapper les remplit en direct ; me prévenir avant que le chemin llama.cpp télécharge son conteneur Docker). GitHub est optionnel : si j'ai un compte GitHub ou la CLI gh, tu peux l'utiliser ; sinon l'accès public suffit. Ne jamais l'exiger sauf s'il figure dans les prérequis ci-dessus. Règles : ne touche à rien en dehors du dossier temporaire et de la cible d'installation. Si quelque chose semble anormal, arrête-toi et demande-moi.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.