多视角频率 LSTM:一种高效的自动语音识别前端
音频与语音处理
2020-07-02 v1 计算与语言
声音
摘要
实时语音识别系统中的声学模型通常堆叠多个单向 LSTM 层以随时间处理声学帧。已有报道称,通过在时间 LSTM 前添加一组频率 LSTM(FLSTM)层,相较于原始 LSTM 架构取得了性能提升。这些 FLSTM 层通过对声学输入信号中的时频相关性建模,可学习到对时间 LSTM 层更鲁棒的输入特征。然而,基于 FLSTM 的架构的一个缺陷是其在预定义且经调优的窗口大小与步长上运行,本文称之为“视角”。我们提出一种简单高效的改进,将具有不同视角的多个 FLSTM 栈的输出组合为降维特征表示。所提出的多视角 FLSTM 架构相较于单视角 FLSTM 模型可建模更广范围的时频相关性。当在 50K 小时英语远场语音数据上以 CTC 损失训练并继以 sMBR 序列训练时,我们表明多视角 FLSTM 声学模型相较于优化后的单 FLSTM 模型,在不同说话人与声学环境场景下取得了 3–7% 的相对词错误率(WER)提升,同时保持相似的计算开销。
引用
@article{arxiv.2007.00131,
title = {Multi-view Frequency LSTM: An Efficient Frontend for Automatic Speech Recognition},
author = {Maarten Van Segbroeck and Harish Mallidih and Brian King and I-Fan Chen and Gurpreet Chadha and Roland Maas},
journal= {arXiv preprint arXiv:2007.00131},
year = {2020}
}