Donner la parole aux langues qui n'ont pas d'outils
En 2023, l'ewé ne disposait d'aucun système de reconnaissance vocale public. Yodi a été construit pour combler ce manque : reconnaître la parole ewé est le premier pas vers la transcription automatique, la traduction et les assistants vocaux dans les langues togolaises.
Architecture du système
Le système associe une cartographie mot-forme d'onde à des classifieurs par réseaux de neurones convolutifs. Le signal acoustique est segmenté en unités correspondant aux mots cibles, puis chaque segment est classifié, ce qui évite de dépendre d'un grand modèle pré-entraîné absent pour la langue.
Un enjeu de données avant tout
Le principal obstacle était l'absence de données audio annotées. Les enregistrements ont été collectés auprès de locuteurs natifs, avec des transcriptions vérifiées par des annotateurs, puis structurés en un corpus de référence pour l'entraînement et l'évaluation.
Limites et héritage
La première version couvre un vocabulaire restreint et un contexte d'enregistrement maîtrisé. Elle établit néanmoins la méthodologie — collecte, annotation, évaluation — que les versions ultérieures de Yodi reprennent et généralisent à d'autres langues et à des domaines ouverts.