Publications scientifiques
Articles, rapports techniques et travaux de recherche sur les langues africaines, le NLP et le Speech AI.
Publications scientifiques
Articles, rapports techniques et travaux de recherche sur les langues africaines, le NLP et le Speech AI.
Kalam-na: A Speech Corpus for the Sara Language Family of Chad
▸ Abstract
Nous présentons Kalam-na, le premier corpus de parole structuré pour la famille de langues Sara du Tchad, comprenant ~37 000 utterances audio sur 12 langues (16 dialectes, ~19 heures, 16-bit/16kHz). Nous décrivons la méthodologie de collecte en milieu communautaire, les défis spécifiques aux langues tonales sous-dotées, et établissons des baselines ASR avec Wav2Vec 2.0 et Whisper fine-tuné. Le corpus est déposé sur HuggingFace et Zenodo sous licence CC-BY-4.0.
BibTeX
@inproceedings{harane-2025-kalam,
title = {Kalam-na: A Speech Corpus for the Sara Language Family of Chad},
author = {Abdel-aziz Harane and {Chad AI Network Consortium}},
booktitle = {Proceedings of the AfricaNLP Workshop at ACL 2025},
year = {2025}
}
Towards Digital Infrastructure for Laal: A Critically Endangered Language Isolate of Chad
▸ Abstract
Le Laal (ISO: gdm) est un isolat linguistique probable du sud du Tchad avec environ 750 locuteurs restants (UNESCO niveau 5). Cet article décrit les premiers travaux de construction d'une infrastructure numérique complète : lexique numérique, corpus audio, système de transcription phonologique, et une approche innovante basée sur la géométrie riemannienne pour représenter les structures tonales grammaticales dans des espaces non-euclidiens adaptés.
BibTeX
@misc{harane-2025-laal,
title = {Towards Digital Infrastructure for Laal},
author = {Abdel-aziz Harane and Florian Lionnet and Pascal Boyeldieu},
year = {2025},
note = {En préparation}
}
Data Governance Frameworks for Community-Owned Language Resources in Africa
▸ Abstract
Nous proposons un cadre de gouvernance pour les ressources linguistiques appartenant aux communautés africaines, inspiré des principes FAIR/CARE, de l'UNESCO et du RGPD. Le cadre couvre le cycle complet : documentation, numérisation, dépôt, accès et révocation du consentement, avec une attention particulière à la séparation entre financement externe et propriété des données.
BibTeX
@inproceedings{harane-2024-governance,
title = {Data Governance Frameworks for Community-Owned Language Resources in Africa},
author = {Abdel-aziz Harane},
booktitle = {Workshop on AI Ethics, Chad AI Network},
year = {2024}
}
Linguistic Atlas of Chad: Mapping 127 Languages with Open Data
▸ Abstract
Ce rapport présente la méthodologie de création de l'Atlas Linguistique Interactif du Tchad, une application web cartographiant 127 langues tchadiennes avec clustering géographique, filtres régionaux et zones colorées. Sources : Ethnologue 27e édition, SIL Chad, CNRS/LLACAN, UNESCO. L'application utilise Leaflet.js avec design responsive adapté aux contraintes de connectivité africaines.
BibTeX
@techreport{harane-2024-atlas,
title = {Linguistic Atlas of Chad: Mapping 127 Languages with Open Data},
author = {Abdel-aziz Harane},
institution = {Chad AI Network},
year = {2024}
}