Aller au contenu principal
GalsenAI
Tous les articles Projet

Constituer un corpus wolof : ce que nous avons appris

Retour sur la collecte et l'annotation des premières heures de parole wolof exploitables pour l'entraînement de modèles.

Équipe Waxal 1 min de lecture

⚠️ Article de démonstration. Le contenu réel viendra de la migration WordPress (CDC §6.1).

Les grands modèles de langue ignorent largement le wolof. Non par choix technique, mais par absence de données : il n’existe pas de corpus public suffisamment large et annoté pour entraîner ou évaluer sérieusement un modèle.

Le point de départ

La première étape a consisté à cartographier ce qui existait déjà — archives radiophoniques, contenus communautaires, transcriptions dispersées — puis à définir un protocole d’annotation tenant compte des variantes régionales.

Ce que nous en retenons

La qualité de l’annotation compte davantage que le volume. Un corpus plus petit mais rigoureusement annoté produit de meilleurs résultats qu’un ensemble large et bruité, en particulier sur les tâches de reconnaissance de la parole.

Poursuivre

À lire ensuite

Tous les articles