面向大词汇量连续语音识别的神经声学到词模型的模块化训练
计算与语言
2018-03-06 v1
摘要
端到端(E2E)自动语音识别(ASR)系统使用统一模型直接将声学映射为词。以往工作多聚焦于 E2E 训练单一模型,将声学与语言模型整合为一体。尽管 E2E 训练受益于序列建模与简化的解码流程,但通常需要大量转写声学数据,且无法利用传统声学与语言建模技术。本文提出一种新颖的 E2E ASR 模块化训练框架,在训练阶段分别训练神经声学模型与语言模型,同时在解码阶段仍进行端到端推断。具体而言,声学到音素模型(A2P)与音素到词模型(P2W)分别利用声学数据与文本数据训练。在 A2P 与 P2W 之间插入音素同步解码(PSD)模块以在不损失精度的情况下缩减序列长度。最终,各模块被集成至声学到词模型(A2W)中,并利用声学数据联合优化以保留序列建模优势。在 300 小时 Switchboard 任务上的实验显示相较直接 A2W 模型有显著提升。所提方法亦令训练与解码效率受益。
引用
@article{arxiv.1803.01090,
title = {On Modular Training of Neural Acoustics-to-Word Model for LVCSR},
author = {Zhehuai Chen and Qi Liu and Hao Li and Kai Yu},
journal= {arXiv preprint arXiv:1803.01090},
year = {2018}
}
备注
accepted by ICASSP2018