中文

低资源ASR的方言适配与数据增强:TalTech在MADASR 2023挑战赛中的系统

计算与语言 2023-10-27 v1 音频与语音处理

摘要

本文描述了塔林理工大学(TalTech)为ASRU MADASR 2023挑战赛开发的系统。该挑战赛聚焦于方言丰富的印度语言的自动语音识别,其训练音频与文本数据有限。TalTech参与了挑战赛的两个赛道:仅允许使用所提供的训练数据的赛道1,以及允许使用额外音频数据的赛道3。在两个赛道中,我们均依赖wav2vec2.0模型。我们的方法在传统微调预训练wav2vec2.0模型流程的两个关键点上有所不同:首先,通过实施对齐数据增强技术以提升训练数据的语言多样性;其次,通过应用深度前缀微调(deep prefix tuning)进行wav2vec2.0模型的方言适配。在两个赛道中,我们的方法相较提供的基线均取得显著改进,在所有参赛队伍中实现了最低的词错误率。

关键词

引用

@article{arxiv.2310.17448,
  title  = {Dialect Adaptation and Data Augmentation for Low-Resource ASR: TalTech Systems for the MADASR 2023 Challenge},
  author = {Tanel Alumäe and Jiaming Kong and Daniil Robnikov},
  journal= {arXiv preprint arXiv:2310.17448},
  year   = {2023}
}