CulturaX
En bref
CulturaX est un jeu de données multilingue ouvert d'environ 6,3 billions de mots-jetons en 167 langues, nettoyé à partir de mC4 et d'OSCAR, qui sert à pré-entraîner des grands modèles de langue.
📖 Définition
💬 En termes simples
C'est comme réunir plusieurs vieilles bibliothèques du Web, en trier le contenu, jeter les doublons et les pages abîmées, puis tout ranger proprement par langue.
💡 Le saviez-vous ?
Dans CulturaX, le français est la 5e langue la plus présente (environ 5 %), derrière l'anglais (45 %), le russe, l'espagnol et l'allemand : plus de la moitié du corpus n'est pas anglophone.
📖 Pour aller plus loin
❓ Questions fréquentes
Qui a créé CulturaX et quand ?
En quoi CulturaX diffère-t-il de mC4 et d'OSCAR ?
CulturaX est-il libre d'accès ?
📚 Sources
- CulturaX: A Cleaned, Enormous, and Multilingual Dataset for Large Language Models in 167 Languages (arXiv:2309.09400) (Nguyen et coll. (University of Oregon, Adobe Research), 2023)
- uonlp/CulturaX - fiche du jeu de données (University of Oregon / Adobe Research (Hugging Face), 2024)
🔗 Termes liés
🏷️ Catégorie parente