面向低资源语音识别的跨语言知识迁移与迭代伪标注:基于Transducer的方法
计算与语言
2023-05-24 v1 音频与语音处理
摘要
语音技术近来已变得无处不在。然而,不同语言的准确率和由此带来的体验差异显著,使得该技术未能实现同等的包容性。不同语言数据的可用性是影响准确率的关键因素之一,尤其是在全神经网络端到端自动语音识别系统的训练中。跨语言知识迁移和迭代伪标注是两种已被证明能有效提升ASR系统准确率的技术,特别是对于乌克兰语等低资源语言。我们的目标是在无人工标注训练数据的情况下,训练一个全神经网络基于Transducer的ASR系统以替代DNN-HMM混合系统。我们表明,使用混合系统生成的转写文本训练的Transducer系统实现了词错误率18%的降低。然而,通过结合来自相关语言的跨语言知识迁移与迭代伪标注,我们能够实现错误率35%的降低。
引用
@article{arxiv.2305.13652,
title = {Cross-lingual Knowledge Transfer and Iterative Pseudo-labeling for Low-Resource Speech Recognition with Transducers},
author = {Jan Silovsky and Liuhui Deng and Arturo Argueta and Tresi Arvizo and Roger Hsiao and Sasha Kuznietsov and Yiu-Chang Lin and Xiaoqiang Xiao and Yuanyuan Zhang},
journal= {arXiv preprint arXiv:2305.13652},
year = {2023}
}