Regex vs LLM for Structured Text
Parsing de documents pas cher pour Muse : un pipeline regex d'abord qui traite 95 %+ du texte structuré, avec score de confiance et validation LLM seulement pour les cas limites. ~95 % d'économies.
- Quoi
- Parsing de documents pas cher pour Muse : un pipeline regex d'abord qui traite 95 %+ du texte structuré, avec score de confiance et validation LLM seulement pour les cas limites. ~95 % d'économies.
- Coût
- Gratuit
- Prérequis
- Utilisez « Regex contre LLM : Texte Structuré » avec votre Muse.
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor : un cadre de décision et un pipeline hybride pour parser du texte structuré qui évite à Muse de brûler de l'argent en appels LLM là où une regex suffisait. L'idée clé : la regex traite 95 à 98 % des cas à bas coût et de façon déterministe, réservez les appels LLM coûteux aux cas limites restants. Architecture : un parser regex extrait la structure d'abord, un nettoyeur de texte retire le bruit (marqueurs, numéros de page, artefacts), un scoreur de confiance signale les extractions à faible confiance (peu de choix, réponse manquante, texte court), et un validateur LLM ne corrige que les éléments signalés, retournant du JSON corrigé ou CORRECT. Inclut une implémentation Python complète (dataclasses figées, jamais de mutation des éléments parsés), des métriques réelles d'un pipeline de quiz en production (410 éléments : 98,0 % de succès regex, 8 éléments à faible confiance, environ 5 appels LLM, ~95 % d'économies contre tout-LLM, 93 % de couverture de tests), un arbre de décision (format répétitif cohérent va regex d'abord, texte libre variable va LLM direct), les bonnes pratiques (commencer par la regex même imparfaite, modèle le moins cher pour la validation, TDD pour les parsers, journaliser les métriques du pipeline), et les anti-modèles à éviter (tout envoyer au LLM, regex pour texte libre, sauter le score de confiance, muter les objets parsés). À utiliser pour parser quiz, formulaires, factures, reçus ou tableaux, choisir entre regex et LLM pour l'extraction, ou optimiser coût et précision d'extraction. Par @affaan-m, listé ici avec crédit à son créateur. Tiré du dépôt affaan-m/ECC (MIT). Bémols honnêtes : les métriques viennent d'un seul pipeline de production, vos résultats varieront avec des entrées plus sales ; la validation LLM nécessite une clé API et un client ; la regex a quand même besoin de tests pour les cas limites et l'encodage. Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage.
Version :
Installation
Copiez le dossier d’installation ci-dessous, puis collez-le dans MuseLe prompt d'installation ci-dessous inclut déjà les étapes de vérification : votre agent suit la checklist communautaire avant d'installer tout ce qui contient du code exécutable. Vous en voulez plus ?
Utilisez « Regex contre LLM : Texte Structuré » avec votre Muse. Prérequis : rien à installer. Pur guide ; une clé API LLM aide si vous voulez l'étape de validation (le modèle le moins cher suffit). 1. Ouvrez le skill : https://github.com/affaan-m/ECC/blob/main/skills/regex-vs-llm-structured-text/SKILL.md et copiez le texte complet du SKILL.md. 2. Collez-le dans un chat avec Muse et ajoutez : « Conçois un pipeline d'extraction hybride regex d'abord pour : [décrivez vos documents]. » 3. Demandez-lui de commencer par le parser regex et le scoreur de confiance, d'ajouter la validation LLM seulement pour les éléments signalés, et de journaliser le taux de succès regex contre le nombre d'appels LLM. Astuce : passez d'abord par l'arbre de décision (« ce format est-il cohérent et répétitif ? ») avant d'écrire le moindre code de parser. Sécurité : un skill est du texte d'instructions ; il n'exécute rien tout seul. Relisez le code généré avant de fusionner.
Enregistré dans vos installs récentes. Retrouvez-le à tout moment sur /connect.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.