VQ-T:使用矢量量化预测网络状态的 RNN Transducer
声音
2022-08-04 v1 计算与语言
音频与语音处理
摘要
束搜索作为端到端模型的主导 ASR 解码算法,生成树结构假设。然而,近期研究表明,使用假设合并的解码能以相当或更优性能实现更高效搜索。但是,循环网络中的完整上下文与假设合并不兼容。我们提出在 RNN transducer 的预测网络中使用矢量量化长短期记忆单元(VQ-LSTM)。通过联合训练离散表示与 ASR 网络,假设可被主动合并以生成格。我们在 Switchboard 语料上的实验表明,所提 VQ RNN transducer 相较带常规预测网络的 transducer 提升了 ASR 性能,同时以相同束大小生成了具有极低 oracle 词错误率(WER)的更密集格。额外的语言模型重打分实验也证明了所提格生成方案的有效性。
引用
@article{arxiv.2208.01818,
title = {VQ-T: RNN Transducers using Vector-Quantized Prediction Network States},
author = {Jiatong Shi and George Saon and David Haws and Shinji Watanabe and Brian Kingsbury},
journal= {arXiv preprint arXiv:2208.01818},
year = {2022}
}
备注
Interspeech 2022 accepted paper