用于声学到词模型的模块化端到端自动语音识别框架
音频与语音处理
2020-08-04 v1 声音
摘要
端到端(E2E)系统在自动语音识别(ASR)中发挥着越来越重要的作用并取得了优异性能。然而,E2E系统直接用输入声学特征识别输出词序列,只能在有限的声学数据上训练。额外的文本数据被广泛用于改进传统人工神经网络-隐马尔可夫模型(ANN-HMM)混合系统的结果。将额外文本数据引入标准E2E ASR系统可能会在解码时破坏E2E特性。本文提出了一种新颖的模块化E2E ASR系统。该模块化E2E ASR系统由两部分组成:声学到音素(A2P)模型和音素到词(P2W)模型。A2P模型在声学数据上训练,而包括大规模文本数据在内的额外数据可用于训练P2W模型。这些附加数据使模块化E2E ASR系统不仅能对声学部分建模,也能对语言部分建模。在解码阶段,两个模型将被集成并作为标准声学到词(A2W)模型工作。换言之,所提出的模块化E2E ASR系统可以轻松地用额外文本数据训练,并以与标准E2E ASR系统相同的方式解码。在Switchboard语料库上的实验结果表明,模块化E2E模型比标准A2W模型获得了更好的词错误率(WER)。
引用
@article{arxiv.2008.00953,
title = {Modular End-to-end Automatic Speech Recognition Framework for Acoustic-to-word Model},
author = {Qi Liu and Zhehuai Chen and Hao Li and Mingkun Huang and Yizhou Lu and Kai Yu},
journal= {arXiv preprint arXiv:2008.00953},
year = {2020}
}
备注
Accepted by IEEE TASLP