基于师生学习的端到端语音识别领域自适应
音频与语音处理
2020-01-08 v1 计算与语言
机器学习
神经与进化计算
声音
摘要
师生(T/S)学习已被证明对混合语音识别系统中深度神经网络声学模型的领域自适应有效。在本文中,我们将 T/S 学习扩展到基于注意力的端到端(E2E)模型的大规模无监督领域自适应,通过两级知识迁移:教师的 token 后验作为软标签,以及最优预测作为解码器引导。为借助真实标签进一步改进 T/S 学习,我们提出自适应 T/S(AT/S)学习。AT/S 不是有条件地从教师的软 token 后验或独热真实标签中选择其一,而是学生始终从教师和真实标签中学习,并为一对软标签和独热标签分配自适应权重以量化各知识源的置信度。置信度分数在每个解码步作为软标签和独热标签的函数动态估计。利用 3400 小时并行的近讲与远场 Microsoft Cortana 数据进行领域自适应,T/S 和 AT/S 相较以相同量远场数据训练的强 E2E 模型分别取得 6.3% 和 10.3% 的相对词错误率提升。
引用
@article{arxiv.2001.01798,
title = {Domain Adaptation via Teacher-Student Learning for End-to-End Speech Recognition},
author = {Zhong Meng and Jinyu Li and Yashesh Gaur and Yifan Gong},
journal= {arXiv preprint arXiv:2001.01798},
year = {2020}
}
备注
8 pages, 2 figures, ASRU 2019