Voxlect:面向全球方言与区域语言的语音基础模型基准
声音
2025-08-05 v1 计算与语言
音频与语音处理
摘要
我们提出Voxlect,这是一个用于建模全球方言和区域语言的语音基础模型基准。具体而言,我们在英语、阿拉伯语、普通话、粤语、藏语、印度语言、泰语、西班牙语、法语、德语、巴西葡萄牙语和意大利语等方言和区域语言变体上报告了全面的基准评估。我们的研究使用来自30个公开语音语料库的超过200万训练语料,这些语料库附带方言信息。我们评估了几种广泛使用的语音基础模型在分类语音方言方面的性能。我们评估了方言模型在噪声条件下的鲁棒性,并提出错误分析,突出了与地理连续性一致的建模结果。除了方言分类基准测试外,我们还演示了Voxlect启用的几个下游应用。具体而言,我们展示了Voxlect可用于增强现有语音识别数据集,添加方言信息,从而实现对方言变异的更详细ASR性能分析。Voxlect也用作评估语音生成系统性能的工具。Voxlect以RAIL系列许可证公开提供,地址为:https://github.com/tiantiaf0627/voxlect。
引用
@article{arxiv.2508.01691,
title = {Voxlect: A Speech Foundation Model Benchmark for Modeling Dialects and Regional Languages Around the Globe},
author = {Tiantian Feng and Kevin Huang and Anfeng Xu and Xuan Shi and Thanathai Lertpetchpun and Jihwan Lee and Yoonjeong Lee and Dani Byrd and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2508.01691},
year = {2025}
}