⚠️ Article de démonstration. Le contenu réel viendra de la migration WordPress (CDC §6.1).
Les grands modèles de langue ignorent largement le wolof. Non par choix technique, mais par absence de données : il n’existe pas de corpus public suffisamment large et annoté pour entraîner ou évaluer sérieusement un modèle.
Le point de départ
La première étape a consisté à cartographier ce qui existait déjà — archives radiophoniques, contenus communautaires, transcriptions dispersées — puis à définir un protocole d’annotation tenant compte des variantes régionales.
Ce que nous en retenons
La qualité de l’annotation compte davantage que le volume. Un corpus plus petit mais rigoureusement annoté produit de meilleurs résultats qu’un ensemble large et bruité, en particulier sur les tâches de reconnaissance de la parole.