Toutes les publications

research

Yodi : le système de reconnaissance vocale pour l'ewé

Équipe de recherche Umbaji

Décrit l'architecture du premier système de reconnaissance vocale pour l'ewé, fondée sur une cartographie mot-forme d'onde et des classifieurs par réseaux de neurones convolutifs.

Publié le 14/03/2023 · ResearchGate · 1 min de lecture

Donner la parole aux langues qui n'ont pas d'outils

En 2023, l'ewé ne disposait d'aucun système de reconnaissance vocale public. Yodi a été construit pour combler ce manque : reconnaître la parole ewé est le premier pas vers la transcription automatique, la traduction et les assistants vocaux dans les langues togolaises.

Architecture du système

Le système associe une cartographie mot-forme d'onde à des classifieurs par réseaux de neurones convolutifs. Le signal acoustique est segmenté en unités correspondant aux mots cibles, puis chaque segment est classifié, ce qui évite de dépendre d'un grand modèle pré-entraîné absent pour la langue.

Un enjeu de données avant tout

Le principal obstacle était l'absence de données audio annotées. Les enregistrements ont été collectés auprès de locuteurs natifs, avec des transcriptions vérifiées par des annotateurs, puis structurés en un corpus de référence pour l'entraînement et l'évaluation.

Limites et héritage

La première version couvre un vocabulaire restreint et un contexte d'enregistrement maîtrisé. Elle établit néanmoins la méthodologie — collecte, annotation, évaluation — que les versions ultérieures de Yodi reprennent et généralisent à d'autres langues et à des domaines ouverts.

CitationÉquipe de recherche Umbaji 2023. “Yodi : le système de reconnaissance vocale pour l'ewé”. ResearchGate
Lire la publication