Vaex out-of-core DataFrames: analyze billions of rows without the RAM
Traiter des datasets tabulaires massifs avec des DataFrames Vaex paresseux et memory-mapped — filtrage, colonnes virtuelles, agrégations rapides, visualisations big data, conversion de formats, intégration ML
- Quoi
- Traiter des datasets tabulaires massifs avec des DataFrames Vaex paresseux et memory-mapped — filtrage, colonnes virtuelles, agrégations rapides, visualisations big data, conversion de formats, intégration ML
- Coût
- Gratuit
- Prérequis
- Python 3.10+ (3.12+ recommandé) ; uv ou pip pour installer vaex ; un gros dataset tabulaire à analyser — le skill est une référence guidée, pas un logiciel
- Installation
- Copiez le prompt d’installation ci-dessous dans votre Muse — votre agent fait le reste.
Sélectionné par Skill Harbor — le skill Vaex de @k-dense-ai pour analyser des datasets tabulaires trop gros pour la RAM — des milliards de lignes traitées à plus d'un milliard de lignes par seconde via des DataFrames out-of-core paresseux et memory-mapped. Couvre six domaines : DataFrames et chargement (HDF5, CSV, Arrow, Parquet, conversion pandas/NumPy), traitement et manipulation (filtrage, colonnes virtuelles, expressions, agrégations groupby), performance et optimisation (lazy evaluation, batching avec delay=True, caching), visualisation (heatmaps, histogrammes, scatter plots via df.viz), intégration ML (scalers, encoders, PCA, K-means, scikit-learn/XGBoost/CatBoost), et I/O (recommandations de formats, stratégies d'export). Inclus : des patterns concrets — convertir un gros CSV en HDF5 pour des chargements futurs instantanés, batcher plusieurs agrégations avec delay=True, et du feature engineering avec des colonnes virtuelles à zéro overhead mémoire. Énonce honnêtement la règle Vaex-vs-alternatives : polars quand les données tiennent en RAM et qu'il faut la vitesse in-memory max, dask pour les clusters distribués, Vaex pour l'analytics out-of-core sur une seule machine. Bémols honnêtes : nécessite Python 3.10+ (3.12+ recommandé avec vaex 4.19.0) ; le skill demande qu'un usage substantiel soit cité dans les manuscrits (arXiv:2609.00065). Licence MIT. Skill Harbor ne vérifie jamais le code, examinez-le vous-même avant usage. Découvert via skills.sh.
Version :
Installation
Prérequis : Python 3.10+ (3.12+ recommandé) ; uv ou pip pour installer vaex ; un gros dataset tabulaire à analyser — le skill est une référence guidée, pas un logiciel Installe-moi « DataFrames Vaex out-of-core : analyser des milliards de lignes sans la RAM ». Il donne à mon agent le manuel Vaex de @k-dense-ai : charger et convertir de gros fichiers (HDF5, CSV, Arrow, Parquet), filtrer et faire du feature engineering avec des colonnes virtuelles à zéro overhead, batcher des agrégations rapides, visualiser des milliards de lignes, construire des pipelines ML, et choisir honnêtement entre Vaex, polars et dask selon la charge. Licence MIT. Dépôt : https://github.com/k-dense-ai/scientific-agent-skills/blob/main/skills/vaex/SKILL.md 1. Récupère le fichier SKILL.md (et les fichiers d'aide éventuels) depuis le chemin du dépôt dans un dossier temporaire et résume en une ou deux phrases ce qu'il fait. 2. Vérification de sécurité : examine le SKILL.md et les scripts pour tout contenu suspect (appels réseau inattendus, commandes shell, collecte d'identifiants). Ce dépôt ne devrait contenir aucun secret en dur, les identifiants uniquement via le coffre sécurisé, les hôtes autorisés déclarés dans le SKILL.md. Vérifie que c'est bien le cas ici ; STOP sur tout signal d'alerte et dis-le-moi. 3. Installe-le comme skill : copie le SKILL.md et ses fichiers d'aide dans le répertoire des skills de l'agent, dans un dossier nommé « vaex ». 4. Vérifie sans appels réseau : frontmatter valide, fichiers en place. 5. Indique ce qui a été installé, où, et ce qu'il me reste à faire moi-même (p. ex. installer vaex via uv pip install vaex ; pointer l'agent vers mes gros fichiers de données ; citer le papier Scientific Agent Skills (arXiv:2609.00065) s'il a substantiellement contribué à un manuscrit). GitHub est optionnel : si j'ai un compte GitHub ou la CLI gh, tu peux l'utiliser ; sinon l'accès public suffit. Ne jamais l'exiger sauf s'il figure dans les prérequis ci-dessus. Règles : ne touche à rien en dehors du dossier temporaire et de la cible d'installation. Si quelque chose semble anormal, arrête-toi et demande-moi.
Questions
Comment installer une création ?
Chaque fiche produit contient un prompt d’installation à copier-coller. Collez-le dans votre Muse et il installe la création pour vous — sans configuration manuelle.
Où va mon argent ?
Directement au vendeur. Skill Harbor ne traite jamais les paiements : le paiement se fait sur la page du vendeur, généralement via Stripe.
Que signifie le ✓ à côté du nom d’un créateur ?
Il signifie que nous avons confirmé l’identité de la personne derrière la fiche. Il ne dit rien sur le code lui-même — vérifiez toujours une création avant de l’installer.