中文

用于延迟可控 ASR 的 RNN-T 及改进集束搜索

计算与语言 2020-01-17 v2 机器学习 音频与语音处理

摘要

基于神经换能器的系统(如用于自动语音识别(ASR)的 RNN Transducers(RNN-T))将传统混合 ASR 系统的各个组件(声学模型、语言模型、标点模型、逆文本规范化)融合为单一模型。这极大简化了训练与推理,从而使 RNN-T 成为 ASR 系统的理想选择。在本工作中,我们研究在推理时需要可调延迟预算的应用中使用 RNN-T。我们还改进了最初提出的 RNN-T 集束搜索算法的解码速度。我们在英文视频 ASR 数据集上评估了所提出的系统,并表明神经 RNN-T 模型相比调优良好的混合 ASR 基线可实现相当的 WER 和更好的计算效率。

关键词

引用

@article{arxiv.1911.01629,
  title  = {RNN-T For Latency Controlled ASR With Improved Beam Search},
  author = {Mahaveer Jain and Kjell Schubert and Jay Mahadeokar and Ching-Feng Yeh and Kaustubh Kalgaonkar and Anuroop Sriram and Christian Fuegen and Michael L. Seltzer},
  journal= {arXiv preprint arXiv:1911.01629},
  year   = {2020}
}