中文

利用声学前瞻改进 RNN-Transducer

计算与语言 2023-07-12 v1 机器学习 音频与语音处理

摘要

RNN-Transducer(RNN-T)因其高准确率和流式能力而作为语音转文本的端到端模型获得广泛接受。典型的 RNN-T 独立编码输入音频和文本上下文,并通过一个轻量联合网络组合两种编码。虽然该架构提供了 SOTA 流式准确率,但它也使模型易受强语言模型偏置的影响,表现为在没有声学证据的情况下文本的多步幻觉。在本文中,我们提出 LookAhead,其通过在音频输入中向前看未来,使文本表示更具声学依据。该技术在域内和域外评测集上均带来了 5%-20% 的词错误率相对降低。

关键词

引用

@article{arxiv.2307.05006,
  title  = {Improving RNN-Transducers with Acoustic LookAhead},
  author = {Vinit S. Unni and Ashish Mittal and Preethi Jyothi and Sunita Sarawagi},
  journal= {arXiv preprint arXiv:2307.05006},
  year   = {2023}
}

备注

5 pages, 1 fig, 7 tables, Proceedings of Interspeech 2023