基于门机制的多口音自适应
音频与语音处理
2020-11-06 v1 计算与语言
声音
摘要
当仅有有限数量的口音语音数据可用时,为提升多口音语音识别性能,常规方法是口音相关自适应,即把基线模型独立地自适应到多个目标口音。为简化自适应流程,我们探索利用多口音混合数据将基线模型同时自适应到多个目标口音。为此,我们提出使用带门机制的口音相关顶层(AST-G)来实现多口音自适应。与基线模型和口音相关自适应相比,AST-G 分别实现了 9.8% 和 1.9% 的平均相对 WER 降低。然而,在真实应用中,我们无法提前获得用于推理的口音类别标签。因此,我们应用口音分类器来预测口音标签。为联合训练声学模型和口音分类器,我们提出了带门机制的多任务学习(MTL-G)。由于口音标签预测可能不准确,其表现不如口音相关自适应。但相较于基线模型,MTL-G 实现了 5.1% 的平均相对 WER 降低。
引用
@article{arxiv.2011.02774,
title = {Multi-Accent Adaptation based on Gate Mechanism},
author = {Han Zhu and Li Wang and Pengyuan Zhang and Yonghong Yan},
journal= {arXiv preprint arXiv:2011.02774},
year = {2020}
}
备注
Accepted in INTERSPEECH 2019