中文

探索数据量对极低资源语言自动语音识别的影响

计算与语言 2025-10-01 v2 声音 音频与语音处理

摘要

本研究探讨了数据增强技术对低资源自动语音识别(ASR)的有效性,重点关注两种濒危的南岛语系语言:阿美语和赛德克语。认识到自监督学习(SSL)在低资源环境中的潜力,我们探索了数据量对 SSL 模型持续预训练的影响。我们提出了一种新颖的数据选择方案,利用多语言语料库来扩充有限的目标语言数据。该方案利用语言分类器提取话语嵌入,并使用单类分类器来识别在语音和音系上与目标语言相近的话语。话语根据其决策得分进行排序和选择,确保将高度相关的数据纳入 SSL-ASR 流程。我们的实验结果证明了该方法的有效性,显著提升了阿美语和赛德克语的 ASR 性能。这些发现强调了通过跨语言迁移学习进行数据增强对于低资源语言 ASR 的可行性和前景。

关键词

引用

@article{arxiv.2409.08872,
  title  = {Exploring the Impact of Data Quantity on ASR in Extremely Low-resource Languages},
  author = {Yao-Fei Cheng and Li-Wei Chen and Hung-Shin Lee and Hsin-Min Wang},
  journal= {arXiv preprint arXiv:2409.08872},
  year   = {2025}
}

备注

Accepted to O-COCOSDA 2025