人人可用的语音技术:基于迁移学习的非母语者英语自动语音识别
音频与语音处理
2021-10-18 v3 计算与语言
机器学习
摘要
为解决英语 ASR(自动语音识别)模型在二语(L2)英语说话者上的性能差距,我们评估了在不同训练设置下,于 L2-ARCTIC(一个非母语英语语音语料库,Zhao 等,2018)上对预训练 wav2vec 2.0 模型(Baevski 等,2020;Xu 等,2021)的微调。我们比较了 \textbf{(a)} 以多种口音混合训练的模型与仅以特定口音训练的模型,以及 \textbf{(b)} 不同单口音模型的结果。我们的实验展示了为非母语英语说话者开发 ASR 模型的前景,即便仅有少量 L2 训练数据,且即便没有语言模型。我们的模型在零样本设定下同样表现出色:我们在多个 L2 数据集上训练,并在盲 L2 测试集上测试。
引用
@article{arxiv.2110.00678,
title = {Speech Technology for Everyone: Automatic Speech Recognition for Non-Native English with Transfer Learning},
author = {Toshiko Shibano and Xinyi Zhang and Mia Taige Li and Haejin Cho and Peter Sullivan and Muhammad Abdul-Mageed},
journal= {arXiv preprint arXiv:2110.00678},
year = {2021}
}
备注
All authors contributed equally. Paper accepted to International Conference on Natural Language and Speech Processing 2021 (ICNLSP 2021)