面向端到端语音识别的声学模型融合
声音
2023-10-12 v1 机器学习
音频与语音处理
摘要
深度学习和自动语音识别(ASR)的最新进展使得端到端(E2E)ASR系统成为可能,并将准确率提升至新水平。E2E系统以在音频-文本对上训练的单一网络隐式建模所有传统ASR组件,如声学模型(AM)和语言模型(LM)。尽管系统架构更简单,将仅在文本语料上训练的独立LM融合进E2E系统已被证明有益。然而,LM融合的应用存在某些缺陷,例如其无法解决内部AM固有的领域不匹配问题。受LM融合概念启发,我们提出将外部AM集成到E2E系统中以更好地解决领域不匹配。通过实施这一新方法,我们实现了词错误率的显著下降,在不同测试集上最高降低达14.3%。我们还发现该AM融合方法特别有利于增强命名实体识别。
引用
@article{arxiv.2310.07062,
title = {Acoustic Model Fusion for End-to-end Speech Recognition},
author = {Zhihong Lei and Mingbin Xu and Shiyi Han and Leo Liu and Zhen Huang and Tim Ng and Yuanyuan Zhang and Ernest Pusateri and Mirko Hannemann and Yaqiao Deng and Man-Hung Siu},
journal= {arXiv preprint arXiv:2310.07062},
year = {2023}
}