Aller au contenu principal
GalsenAI

Datasets

Reconnaissance vocale

Les jeux de données du catalogue relevant du domaine « Reconnaissance vocale ».

3 jeux de données dans cette sélection

  • Reconnaissance vocale

    Jeu de données de reconnaissance automatique de la parole en wolof, construit en réunissant quatre corpus existants et leurs transcriptions. Pensé pour l'entraînement de modèles ASR, c'est le plus large ensemble audio transcrit en wolof publié par la communauté.

    • Wolof
    Volume
    35 075 extraits audio · 6,5 Go
    Licence
    Apache 2.0

    Ouvrir sur Hugging Face

  • Reconnaissance vocale

    Corpus de parole transcrite consacré à l'agriculture dans les trois langues les plus parlées du Sénégal. Les enregistrements réunissent agriculteurs, conseillers agricoles et responsables d'entreprises agroalimentaires, à travers des émissions de radio interactives, des groupes de discussion, des messages vocaux et des entretiens. Projet financé par le Lacuna Fund.

    • Wolof
    • Pulaar
    • Sérère
    Volume
    125 h de parole transcrite, dont 35 h vérifiées
    Licence
    CC BY 4.0

    Ouvrir sur Zenodo

  • Reconnaissance vocale

    Correction de la partie wolof du corpus WAXAL publié par Google, dont les fichiers audio et les transcriptions présentaient un défaut d'alignement qui rendait la ressource inutilisable. La communauté a régénéré les transcriptions puis réaligné l'ensemble, rendant le corpus de nouveau exploitable.

    • Wolof
    Volume
    1 042 extraits audio · 6,1 Go
    Licence
    Licence non précisée par le producteur — vérifiez les conditions de réutilisation avant usage

    Ouvrir sur Hugging Face