ADI-20:阿拉伯方言识别数据集与模型
计算与语言
2025-11-14 v1
摘要
我们提出 ADI-20,这是前一版本 ADI-17 中阿拉伯方言识别 (ADI) 数据集的扩展。ADI-20 涵盖所有阿拉伯语国家的方言,包含来自 19 个阿拉伯方言以及现代标准阿拉伯语 (MSA) 的 3,556 小时的语料。我们使用该数据集训练和评估了各种最新 ADI 系统。我们探索了微调预训练的 ECAPA-TDNN 模型以及使用注意力池化层和分类密集层耦合的 Whisper 编码器块。我们研究了 (i) 训练数据规模和 (ii) 模型参数数量对识别性能的影响。我们的结果表明,在仅使用原始训练数据的 30% 时,F1 分数会有所下降。我们开源收集的数据和训练好的模型,以便复现我们的工作,以及支持 ADI 进一步研究。
引用
@article{arxiv.2511.10070,
title = {ADI-20: Arabic Dialect Identification dataset and models},
author = {Haroun Elleuch and Salima Mdhaffar and Yannick Estève and Fethi Bougares},
journal= {arXiv preprint arXiv:2511.10070},
year = {2025}
}
备注
Published in Interspeech 2025