Recherche
YodiV3 : le traitement des langues togolaises avec le corpus Eyaa-Tom et la métrique Lom
Présente Eyaa-Tom, un corpus parallèle multi-domaines pour dix langues togolaises et deux lingua franca, et propose la métrique Lom pour quantifier le niveau de préparation à l'IA de chaque langue.
Pourquoi les langues togolaises sont absentes de l'IA
Les modèles de langue actuels ignorent presque toutes les langues d'Afrique de l'Ouest faute de corpus structurés. YodiV3 attaque ce problème à la racine : en documentant dix langues togolaises dans un corpus public, puis en mesurant mathématiquement où chacune en est sur la route de l'IA.
Eyaa-Tom, un corpus conçu pour être réel
Eyaa-Tom est un corpus parallèle multi-domaines : les textes ne viennent pas de pages web traduites à la machine mais de conversations, d'administrations et de situations de santé réellement collectées. Une communauté de locuteurs natifs produit et valide les paires de phrases.
- Dix langues togolaises couvertes et deux lingua franca de référence
- Des domaines d'usage quotidien, pas seulement de l'écrit administratif
- Une double validation humaine avant publication
La métrique Lom
Lom quantifie le niveau de préparation à l'IA d'une langue : volume de données disponibles, couverture de domaines, présence de ressources parallèles et capacité à entraîner des modèles utiles. Plutôt qu'un classement fixe, Lom donne à chaque langue un diagnostic actionnable pour décider des prochaines collectes.
Résultats et suites
Les premiers modèles entraînés sur Eyaa-Tom montrent que la transcription et la traduction restent possibles même avec des volumes modestes, pourvu que la qualité et le domaine soient maîtrisés. Le corpus et les scores Lom sont publiés ouvertement, et les prochaines itérations visent les langues les moins dotées.