ARCADE:用于细粒度阿拉伯方言标记的城市规模语料库
计算与语言
2026-01-06 v1 计算机与社会
声音
摘要
阿拉伯语言以丰富的地区方言纹理为特征,这些方言在语音和词汇上有显著差异,反映了其说话者的地理和文化多样性。尽管已有许多多方言数据集,但将语音映射到如城市等细粒度方言来源仍未得到充分探索。我们提出ARCADE(Arabic Radio Corpus for Audio Dialect Evaluation),这是第一个专为城市级别方言粒度设计的阿拉伯语语音数据集。该语料库来自阿拉伯世界的流媒体广播服务收集的阿拉伯语广播语音。我们的数据管道从经验证的广播流中提取30秒语段,涵盖现代标准阿拉伯语(MSA)和多种方言语音。为确保可靠性,每段语音均由1至3名母语阿拉伯语评论员进行标注,分配丰富的元数据,包括情感、言语类型、方言类别以及用于方言识别任务的有效性标记。最终的语料库包含6,907个标注和3,790个唯一音频段,覆盖58个城市,遍及19个国家。这些细粒度标注支持多任务学习,作为城市级别方言标记的基准。我们详细描述了数据收集方法,评估了音频质量,并提供标签分布的全面分析。该数据集已发布于:https://huggingface.co/datasets/riotu-lab/ARCADE-full
引用
@article{arxiv.2601.02209,
title = {ARCADE: A City-Scale Corpus for Fine-Grained Arabic Dialect Tagging},
author = {Omer Nacar and Serry Sibaee and Adel Ammar and Yasser Alhabashi and Nadia Samer Sibai and Yara Farouk Ahmed and Ahmed Saud Alqusaiyer and Sulieman Mahmoud AlMahmoud and Abdulrhman Mamdoh Mukhaniq and Lubaba Raed and Sulaiman Mohammed Alatwah and Waad Nasser Alqahtani and Yousif Abdulmajeed Alnasser and Mohamed Aziz Khadraoui and Wadii Boulila},
journal= {arXiv preprint arXiv:2601.02209},
year = {2026}
}