AfriQA
CollaboratifLe premier jeu de questions-réponses multilingue conçu pour les langues africaines.
- Question-réponse
- Langues africaines
- Corpus
Recherche et données
Ce que la communauté construit, et ce qui en sort. Les projets d'un côté, les corpus qu'ils produisent de l'autre.
Les projets
Des travaux portés par GalsenAI et des initiatives collaboratives auxquelles elle participe.
Le premier jeu de questions-réponses multilingue conçu pour les langues africaines.
Initiative panafricaine de traduction automatique, à laquelle des membres de GalsenAI contribuent.
Détection de mots-clés parlés dans six langues sénégalaises.
Un modèle de synthèse vocale en wolof.
Des modèles multilingues ouverts, construits par des milliers de chercheurs.
Un modèle de traduction pour les langues sénégalaises.
Les jeux de données
Les langues du Sénégal restent peu dotées en données exploitables. Cette section réunit les corpus produits par la communauté et ceux qu'elle recommande, avec pour chacun son domaine, ses langues, son volume et sa licence.
13 jeux de données référencés
Synthèse vocale
Version nettoyée et débruitée de la voix féminine du corpus Wolof TTS. Les annotations ont été reprises pour retirer caractères spéciaux, émojis et caractères étrangers, et les extraits jugés de qualité insuffisante ont été écartés. Représente 18 h 41 min de parole exploitable.
Ouvrir sur Hugging Face
Reconnaissance vocale
Jeu de données de reconnaissance automatique de la parole en wolof, construit en réunissant quatre corpus existants et leurs transcriptions. Pensé pour l'entraînement de modèles ASR, c'est le plus large ensemble audio transcrit en wolof publié par la communauté.
Ouvrir sur Hugging Face
Synthèse vocale
Corpus de synthèse vocale enregistré par deux locuteurs natifs du wolof, une voix masculine et une voix féminine, chacun ayant lu plus de 20 000 phrases. Collecté par Baamtu Datamation dans le cadre du programme AI4D African Language Program, il constitue la base de référence pour la synthèse vocale en wolof.
Ouvrir sur Hugging Face
Traduction automatique
Agrégation des différentes sources de traduction wolof-français disponibles au sein de la communauté, réunies dans un format unique avec traçabilité de la source de chaque paire. C'est le corpus parallèle wolof-français le plus volumineux publié par GalsenAI.
Ouvrir sur Hugging Face
Traduction automatique
Corpus parallèle anglais-wolof de petite taille, pensé pour l'évaluation rapide et l'amorçage de modèles de traduction vers l'anglais.
Ouvrir sur Hugging Face
Traduction automatique
Jeu d'évaluation de référence pour la traduction automatique, couvrant 200 langues dont le wolof. Les mêmes phrases étant traduites dans toutes les langues, il permet de comparer les performances d'un modèle wolof à celles obtenues sur des langues mieux dotées.
Ouvrir sur Hugging Face
Traduction automatique
Corpus parallèle français-wolof aligné phrase à phrase, chaque paire conservant la mention de sa source d'origine. Utilisé pour l'entraînement des modèles de traduction de la communauté.
Ouvrir sur Hugging Face
Reconnaissance vocale
Corpus de parole transcrite consacré à l'agriculture dans les trois langues les plus parlées du Sénégal. Les enregistrements réunissent agriculteurs, conseillers agricoles et responsables d'entreprises agroalimentaires, à travers des émissions de radio interactives, des groupes de discussion, des messages vocaux et des entretiens. Projet financé par le Lacuna Fund.
Ouvrir sur Zenodo
Traduction automatique
Corpus parallèle de traduction dans le domaine de l'actualité, couvrant 21 langues africaines dont le wolof, avec le français et l'anglais comme langues pivots. Également issu du collectif Masakhane.
Ouvrir sur Hugging Face
Reconnaissance d'entités
Corpus de reconnaissance d'entités nommées couvrant 20 langues africaines, dont le wolof. Produit par le collectif Masakhane, auquel des membres de GalsenAI contribuent. Les annotations couvrent personnes, lieux, organisations et dates.
Ouvrir sur Hugging Face
Classification audio
Jeu de données de commandes vocales couvrant le wolof, le pulaar et le sérère, annoté par mot-clé. Chaque extrait audio est associé à l'un des mots du vocabulaire cible, ce qui en fait une ressource adaptée à la détection de mots-clés et aux interfaces vocales en langues nationales.
Ouvrir sur Hugging Face
Reconnaissance vocale
Correction de la partie wolof du corpus WAXAL publié par Google, dont les fichiers audio et les transcriptions présentaient un défaut d'alignement qui rendait la ressource inutilisable. La communauté a régénéré les transcriptions puis réaligné l'ensemble, rendant le corpus de nouveau exploitable.
Ouvrir sur Hugging Face
Corpus textuel
Corpus textuel monolingue en wolof, destiné au pré-entraînement et à l'adaptation de modèles de langue. Sert de base aux travaux de modélisation linguistique du wolof menés dans la communauté.
Ouvrir sur Hugging Face
Si vous travaillez sur les langues sénégalaises, sur un corpus ouvert ou sur un modèle que la communauté pourrait reprendre, écrivez-nous.