中文

面向开放域 ASR 的上下文 RNN-T

音频与语音处理 2020-08-14 v2 计算与语言 机器学习 声音

摘要

用于自动语音识别(ASR)的端到端(E2E)系统,如 RNN Transducer (RNN-T) 与 Listen-Attend-Spell (LAS),将传统混合 ASR 系统的各个组件——声学模型、语言模型、发音模型——融合为单一神经网络。虽然这具有一些良好优势,但它将系统的训练限制为仅能使用配对的音频与文本。因此,E2E 模型往往难以正确识别训练期间不常出现的稀有词,例如实体名称。在本文中,我们提出对 RNN-T 模型的改进,使模型能够利用额外的元数据文本,以期提升在这些命名实体词上的性能。我们在一个从去标识化的公共社交媒体视频中采样的内部数据集上评估我们的方法,该数据集代表一项开放域 ASR 任务。通过使用注意力模型与偏置模型来利用伴随视频的上下文元数据,我们观察到在具有相关元数据的视频上,命名实体词错误率(WER-NE)相对提升约 16%。

关键词

引用

@article{arxiv.2006.03411,
  title  = {Contextual RNN-T For Open Domain ASR},
  author = {Mahaveer Jain and Gil Keren and Jay Mahadeokar and Geoffrey Zweig and Florian Metze and Yatharth Saraf},
  journal= {arXiv preprint arXiv:2006.03411},
  year   = {2020}
}