面向端到端语音识别模型向低资源语言扩展的半监督迁移学习
音频与语音处理
2021-11-22 v1 计算与语言
声音
摘要
本文提出一种三阶段训练方法以提升低资源语言的语音识别准确率。我们探索并提出了如迁移学习、编码器冻结、使用文本转语音(TTS)的数据增强以及半监督学习(SSL)等技术的有效组合。为提升低资源意大利语ASR的准确率,我们分别利用迁移学习、TTS增强与SSL,借助训练良好的英语模型、无标签文本语料与无标签音频语料。在第一阶段,我们使用来自训练良好的英语模型的迁移学习,这主要有助于从资源丰富的语言中学习声学信息,该阶段相较基线实现了约24%的相对词错率(WER)降低。在第二阶段,我们通过TTS数据增强利用无标签文本数据将语言信息融入模型,并探索在此阶段冻结声学编码器。TTS数据增强帮助我们进一步相对降低WER约21%。最后,在第三阶段,我们通过来自无标签音频数据的SSL将WER再相对降低4%。总体而言,我们的两遍语音识别系统(第一遍使用单调分块注意力(MoChA),第二遍使用全注意力)相较基线实现了约42%的相对WER降低。
引用
@article{arxiv.2111.10047,
title = {Semi-supervised transfer learning for language expansion of end-to-end speech recognition models to low-resource languages},
author = {Jiyeon Kim and Mehul Kumar and Dhananjaya Gowda and Abhinav Garg and Chanwoo Kim},
journal= {arXiv preprint arXiv:2111.10047},
year = {2021}
}
备注
Accepted as a conference paper at ASRU 2021