中文

ASR 基础模型是否足够通用,以捕捉低资源语言地区方言特征?

计算与语言 2025-10-30 v2

摘要

传统的语音识别建模研究依赖于大多数低资源语言的规范形式,而区域方言的自动语音识别则被视为微调任务。为调查方言变异对语音识别的影响,我们开发了一个 78 小时标注的班加勒语语音转文本(Stt)语料库,命名为 Ben-10。从语言和数据驱动的视角分析显示,语音基础模型在区域方言语音识别方面面临严重挑战,无论是零样本还是微调设置下均如此。我们观察到所有深度学习方法在处理方言变异下的语音数据方面都难以建模,但方言特定的模型训练可缓解此问题。我们的数据也作为受限资源下的语音识别算法的 out-of-distribution(OOD)资源。本项目开发的数据和代码已公开available

关键词

引用

@article{arxiv.2510.23252,
  title  = {Are ASR foundation models generalized enough to capture features of regional dialects for low-resource languages?},
  author = {Tawsif Tashwar Dipto and Azmol Hossain and Rubayet Sabbir Faruque and Md. Rezuwan Hassan and Kanij Fatema and Tanmoy Shome and Ruwad Naswan and Md. Foriduzzaman Zihad and Mohaymen Ul Anam and Nazia Tasnim and Hasan Mahmud and Md Kamrul Hasan and Md. Mehedi Hasan Shawon and Farig Sadeque and Tahsin Reasat},
  journal= {arXiv preprint arXiv:2510.23252},
  year   = {2025}
}

备注

The manuscript has to be withdrawn to address an authorship and intellectual property clarification