LLaVA — vision-language assistant patterns (short listing)
Fiche courte (licence non vérifiable) : aide-mémoire de référence pour les modèles vision-langage LLaVA — chat image multi-tours, VQA, tailles de modèle et VRAM, quantification, recettes d'entraînement
- Quoi
- Fiche courte (licence non vérifiable) : aide-mémoire de référence pour les modèles vision-langage LLaVA — chat image multi-tours, VQA, tailles de modèle et VRAM, quantification, recettes d'entraînement
- Coût
- Gratuit
- Prérequis
- un GPU avec 14 Go+ de VRAM (ou ~4 Go en quantification 4 bits) ; Python 3.x ; torch, transformers, pillow ; poids du modèle téléchargés depuis les sources LLaVA officielles (leurs propres licences s'appliquent)
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor — fiche courte (le frontmatter revendique MIT, mais le manifest de découverte enregistre NOASSERTION, donc aucun contenu n'est reproduit ici) : le skill llava de @ovachiever, listé ici avec crédit à son créateur — un aide-mémoire de référence pour les modèles vision-langage open-source LLaVA (Large Language and Vision Assistant) : chat image conversationnel multi-tours, question-réponse visuelle (VQA), description d'images et compréhension de documents, tableau tailles/VRAM (7B à 34B), recettes de quantification 4/8 bits pour réduire la VRAM, service CLI et Gradio, scripts d'entraînement de modèles sur mesure (alignement de features + visual instruction tuning), scores de benchmarks, et limitations honnêtes (hallucinations, raisonnement spatial faible, difficulté avec le petit texte). Bémols honnêtes : ce skill référence le projet LLaVA en amont (haotian-liu/LLaVA) plutôt que de le redistribuer — télécharge toi-même les vrais poids depuis les sources officielles ; un vrai GPU est requis (14 Go+ de VRAM pour le 7B, ~4 Go quantifié) — l'inférence CPU est impraticable ; les poids des modèles ont leurs propres licences, distinctes du texte du skill. Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage. Découvert via skills.sh.
Version :
Installation
Prérequis : un GPU avec 14 Go+ de VRAM (ou ~4 Go en quantification 4 bits) ; Python 3.x ; torch, transformers, pillow ; poids du modèle téléchargés depuis les sources LLaVA officielles (leurs propres licences s'appliquent) Installe-moi « LLaVA — patterns d'assistant vision-langage (fiche courte) ». Il donne à mon agent l'aide-mémoire LLaVA de @ovachiever : chat image multi-tours, question-réponse visuelle, description et compréhension de documents, tableau tailles/VRAM, recettes de quantification, service CLI et Gradio, scripts d'entraînement sur mesure et limitations honnêtes. IMPORTANT : la licence n'était pas vérifiable (le manifest de découverte enregistre NOASSERTION) — récupérer depuis le lien seulement, ne rien reproduire au-delà du lien, et lire toi-même les conditions avant usage. Le skill référence le projet LLaVA en amont ; il ne livre pas les poids du modèle. Dépôt : https://github.com/ovachiever/droid-tings/blob/master/skills/llava/SKILL.md 1. Récupère le fichier SKILL.md (et les fichiers d'aide éventuels) depuis le chemin du dépôt dans un dossier temporaire et résume en une ou deux phrases ce qu'il fait. 2. Vérification de sécurité : examine le SKILL.md et les scripts pour tout contenu suspect (appels réseau inattendus, commandes shell, collecte d'identifiants). Les scripts d'entraînement et de quantification téléchargent des fichiers lourds — note les sources attendues ; tout le reste est un signal d'alerte. Ce dépôt ne devrait contenir aucun secret en dur. Vérifie que c'est bien le cas ici ; STOP sur tout signal d'alerte et dis-le-moi. 3. Installe-le comme skill : copie le SKILL.md et ses fichiers d'aide dans le répertoire des skills de l'agent, dans un dossier nommé « llava ». 4. Vérifie sans appels réseau : frontmatter valide, fichiers en place. 5. Indique ce qui a été installé, où, et ce qu'il me reste à faire moi-même (p. ex. installer torch/transformers/pillow, télécharger les poids depuis les sources officielles sous leurs propres licences, vérifier la VRAM de mon GPU contre le tableau). GitHub est optionnel : si j'ai un compte GitHub ou la CLI gh, tu peux l'utiliser ; sinon l'accès public suffit. Ne jamais l'exiger sauf s'il figure dans les prérequis ci-dessus. Règles : ne touche à rien en dehors du dossier temporaire et de la cible d'installation. Si quelque chose semble anormal, arrête-toi et demande-moi.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.