Aller au contenu principal
GalsenAI

Datasets

Jeux de données · Wolof

Les corpus du catalogue qui couvrent le wolof, seuls ou en combinaison avec d'autres langues.

13 jeux de données dans cette sélection

  • Synthèse vocale

    Version nettoyée et débruitée de la voix féminine du corpus Wolof TTS. Les annotations ont été reprises pour retirer caractères spéciaux, émojis et caractères étrangers, et les extraits jugés de qualité insuffisante ont été écartés. Représente 18 h 41 min de parole exploitable.

    • Wolof
    Volume
    19 947 extraits audio · 18 h 41 min
    Licence
    CC BY 4.0

    Ouvrir sur Hugging Face

  • Reconnaissance vocale

    Jeu de données de reconnaissance automatique de la parole en wolof, construit en réunissant quatre corpus existants et leurs transcriptions. Pensé pour l'entraînement de modèles ASR, c'est le plus large ensemble audio transcrit en wolof publié par la communauté.

    • Wolof
    Volume
    35 075 extraits audio · 6,5 Go
    Licence
    Apache 2.0

    Ouvrir sur Hugging Face

  • Synthèse vocale

    Corpus de synthèse vocale enregistré par deux locuteurs natifs du wolof, une voix masculine et une voix féminine, chacun ayant lu plus de 20 000 phrases. Collecté par Baamtu Datamation dans le cadre du programme AI4D African Language Program, il constitue la base de référence pour la synthèse vocale en wolof.

    • Wolof
    Volume
    40 010 extraits audio · 4,6 Go
    Licence
    CC BY 4.0

    Ouvrir sur Hugging Face

  • Traduction automatique

    Agrégation des différentes sources de traduction wolof-français disponibles au sein de la communauté, réunies dans un format unique avec traçabilité de la source de chaque paire. C'est le corpus parallèle wolof-français le plus volumineux publié par GalsenAI.

    • Wolof
    • Français
    Volume
    98 345 paires de phrases
    Licence
    Licence non précisée par le producteur — vérifiez les conditions de réutilisation avant usage

    Ouvrir sur Hugging Face

  • Traduction automatique

    Corpus parallèle anglais-wolof de petite taille, pensé pour l'évaluation rapide et l'amorçage de modèles de traduction vers l'anglais.

    • Wolof
    • Anglais
    Volume
    7 405 paires de phrases
    Licence
    Licence non précisée par le producteur — vérifiez les conditions de réutilisation avant usage

    Ouvrir sur Hugging Face

  • Traduction automatique

    Jeu d'évaluation de référence pour la traduction automatique, couvrant 200 langues dont le wolof. Les mêmes phrases étant traduites dans toutes les langues, il permet de comparer les performances d'un modèle wolof à celles obtenues sur des langues mieux dotées.

    • Wolof
    • Français
    • Anglais
    • Multilingue
    Volume
    200 langues
    Licence
    CC BY-SA 4.0

    Ouvrir sur Hugging Face

  • Traduction automatique

    Corpus parallèle français-wolof aligné phrase à phrase, chaque paire conservant la mention de sa source d'origine. Utilisé pour l'entraînement des modèles de traduction de la communauté.

    • Wolof
    • Français
    Volume
    17 777 paires de phrases
    Licence
    Licence non précisée par le producteur — vérifiez les conditions de réutilisation avant usage

    Ouvrir sur Hugging Face

  • Reconnaissance vocale

    Corpus de parole transcrite consacré à l'agriculture dans les trois langues les plus parlées du Sénégal. Les enregistrements réunissent agriculteurs, conseillers agricoles et responsables d'entreprises agroalimentaires, à travers des émissions de radio interactives, des groupes de discussion, des messages vocaux et des entretiens. Projet financé par le Lacuna Fund.

    • Wolof
    • Pulaar
    • Sérère
    Volume
    125 h de parole transcrite, dont 35 h vérifiées
    Licence
    CC BY 4.0

    Ouvrir sur Zenodo

  • Traduction automatique

    Corpus parallèle de traduction dans le domaine de l'actualité, couvrant 21 langues africaines dont le wolof, avec le français et l'anglais comme langues pivots. Également issu du collectif Masakhane.

    • Wolof
    • Français
    • Anglais
    • Multilingue
    Volume
    21 langues africaines
    Licence
    CC BY-NC 4.0

    Ouvrir sur Hugging Face

  • Reconnaissance d'entités

    Corpus de reconnaissance d'entités nommées couvrant 20 langues africaines, dont le wolof. Produit par le collectif Masakhane, auquel des membres de GalsenAI contribuent. Les annotations couvrent personnes, lieux, organisations et dates.

    • Wolof
    • Multilingue
    Volume
    20 langues africaines
    Licence
    AFL 3.0

    Ouvrir sur Hugging Face

  • Classification audio

    Jeu de données de commandes vocales couvrant le wolof, le pulaar et le sérère, annoté par mot-clé. Chaque extrait audio est associé à l'un des mots du vocabulaire cible, ce qui en fait une ressource adaptée à la détection de mots-clés et aux interfaces vocales en langues nationales.

    • Wolof
    • Pulaar
    • Sérère
    Volume
    Entre 10 000 et 100 000 extraits
    Licence
    CreativeML OpenRAIL-M

    Ouvrir sur Hugging Face

  • Reconnaissance vocale

    Correction de la partie wolof du corpus WAXAL publié par Google, dont les fichiers audio et les transcriptions présentaient un défaut d'alignement qui rendait la ressource inutilisable. La communauté a régénéré les transcriptions puis réaligné l'ensemble, rendant le corpus de nouveau exploitable.

    • Wolof
    Volume
    1 042 extraits audio · 6,1 Go
    Licence
    Licence non précisée par le producteur — vérifiez les conditions de réutilisation avant usage

    Ouvrir sur Hugging Face

  • Corpus textuel

    Corpus textuel monolingue en wolof, destiné au pré-entraînement et à l'adaptation de modèles de langue. Sert de base aux travaux de modélisation linguistique du wolof menés dans la communauté.

    • Wolof
    Volume
    52 706 phrases
    Licence
    Licence non précisée par le producteur — vérifiez les conditions de réutilisation avant usage

    Ouvrir sur Hugging Face