基于门控循环单元并利用未来上下文的声学建模
计算与语言
2018-05-21 v1 声音
音频与语音处理
摘要
使用未来上下文信息通常被证明有助于声学建模。然而,对于循环神经网络(RNN),有效建模未来时间上下文并保持较低模型延迟并不容易。本文中,我们尝试设计一种RNN声学模型,能够以尽可能低的模型延迟和计算成本有效且直接地利用未来上下文。所提模型基于极小门控循环单元(mGRU),并在其中插入了输入投影层。为此架构专门设计了两种上下文模块,即时间编码和时间卷积,用于建模未来上下文。在Switchboard任务和一个内部中文ASR任务上的实验结果表明,所提模型表现远优于长短期记忆(LSTM)和mGRU模型,同时支持最大延迟为170 ms的在线解码。该模型甚至在模型延迟更小、参数几乎少一半的情况下,优于一个极强的基线TDNN-LSTM。
引用
@article{arxiv.1805.07024,
title = {Gated Recurrent Unit Based Acoustic Modeling with Future Context},
author = {Jie Li and Xiaorui Wang and Yuanyuan Zhao and Yan Li},
journal= {arXiv preprint arXiv:1805.07024},
year = {2018}
}
备注
Submitted to INTERSPEECH 2018