LLM guardrails for security — input/output validation with NeMo Guardrails, Presidio, and Guardrails AI
Durcir les applis LLM avec des garde-fous d'entrées/sorties — flows NeMo Guardrails (Colang), validateurs Python de PII et contrôles de schéma Guardrails AI contre injection de prompt, fuites de PII et hallucinations
- Quoi
- Durcir les applis LLM avec des garde-fous d'entrées/sorties — flows NeMo Guardrails (Colang), validateurs Python de PII et contrôles de schéma Guardrails AI contre injection de prompt, fuites de PII et hallucinations
- Coût
- Gratuit
- Prérequis
- un environnement Python 3.10+ avec pip ; une clé API OpenAI (facturée) OU un endpoint LLM local pour les rails self-check de NeMo Guardrails
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor — le skill de garde-fous de @mukul975 : un guide défensif complet pour ajouter des contrôles de sécurité d'entrées/sorties aux applications LLM. L'agent installe les frameworks de garde-fous (NeMo Guardrails pour les flows de rails en Colang, Guardrails AI pour la validation structurée des sorties, Microsoft Presidio et spaCy pour la détection de PII), exécute un pipeline de garde-fous en plusieurs modes (complet, entrées seules, sorties seules, expurgation de PII, JSON pour dashboards), rédige des politiques de contenu JSON (sujets autorisés/bloqués, patterns bloqués, catégories de PII), écrit des définitions de flows Colang 2.0 (rails d'entrée comme self-check, détection de jailbreak, masquage de données sensibles ; rails de sortie comme détection d'hallucination), et déploie le tout comme middleware de validation autour d'une appli LLM ou d'un pipeline RAG. Il fournit des explications des concepts clés, un inventaire des outils, des vérifications (patterns d'injection bloqués, PII expurgées, latence <200 ms en mode entrées seules) et une limite de scope honnête : les garde-fous sont de la défense en profondeur, pas un remplacement de l'authentification, de l'autorisation ou de la sécurité réseau. Bémols honnêtes : requiert Python 3.10+ et de vraies installations (nemoguardrails, presidio, un modèle spaCy) ; les rails self-check appellent un modèle — clé API OpenAI (facturée) ou endpoint LLM local, donc les coûts sont évitables avec un modèle local. Licence Apache-2.0 (frontmatter et manifest concordants). Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage. Découvert via skills.sh.
Version :
Installation
Prérequis : un environnement Python 3.10+ avec pip ; une clé API OpenAI (facturée) OU un endpoint LLM local pour les rails self-check de NeMo Guardrails Installe-moi « Garde-fous LLM pour la sécurité — validation entrées/sorties avec NeMo Guardrails, Presidio et Guardrails AI ». Il donne à mon agent le guide défensif de garde-fous de @mukul975 : installer les frameworks de garde-fous (nemoguardrails, guardrails-ai, presidio-analyzer, presidio-anonymizer, spacy + un modèle de langue), exécuter l'agent de sécurité des garde-fous en modes complet/entrées seules/sorties seules/PII/JSON, rédiger une politique de contenu JSON (sujets autorisés et bloqués, patterns bloqués, catégories de PII, limites de sortie), définir des flows de rails Colang 2.0 (self check input, check jailbreak, mask sensitive data, self check output, hallucination check), intégrer le pipeline comme middleware de validation autour d'une appli LLM ou d'un pipeline RAG, et passer en revue les logs pour les taux de blocage et tentatives de contournement. Licence Apache-2.0. Dépôt : https://github.com/mukul975/anthropic-cybersecurity-skills/blob/main/skills/implementing-llm-guardrails-for-security/SKILL.md 1. Récupère le fichier SKILL.md (et les fichiers d'aide éventuels) depuis le chemin du dépôt dans un dossier temporaire et résume en une ou deux phrases ce qu'il fait. 2. Vérification de sécurité : examine le SKILL.md et les scripts pour tout contenu suspect (appels réseau inattendus, commandes shell, collecte d'identifiants). Ce dépôt ne devrait contenir aucun secret en dur, les identifiants seulement via variables d'environnement, hôtes autorisés déclarés dans le SKILL.md. Vérifie que c'est bien le cas ici ; STOP sur tout signal d'alerte et dis-le-moi. 3. Installe-le comme skill : copie le SKILL.md et ses fichiers d'aide dans le répertoire des skills de l'agent, dans un dossier nommé « implementing-llm-guardrails-for-security ». 4. Vérifie sans appels réseau : frontmatter valide, fichiers en place. 5. Indique ce qui a été installé, où, et ce qu'il me reste à faire moi-même (p. ex. pip install des packages de garde-fous et d'un modèle spaCy, définir OPENAI_API_KEY ou pointer les rails self-check vers un endpoint LLM local, rédiger ma politique de contenu JSON). GitHub est optionnel : si j'ai un compte GitHub ou la CLI gh, tu peux l'utiliser ; sinon l'accès public suffit. Ne jamais l'exiger sauf s'il figure dans les prérequis ci-dessus. Règles : ne touche à rien en dehors du dossier temporaire et de la cible d'installation. Si quelque chose semble anormal, arrête-toi et demande-moi.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.