中文

在声学到词 ASR 中利用外部语言模型改进 OOV 检测与消解

计算与语言 2019-09-27 v1

摘要

声学到词(A2W)端到端自动语音识别(ASR)系统因其极度简化的架构和快速解码而受到关注。为缓解因低频词导致的数据稀疏问题,研究了其与声学到字符(A2C)模型的结合。此外,A2C 模型可用于恢复未被 A2W 模型覆盖的词汇外(OOV)词,但这需要准确检测 OOV 词。A2W 模型从声学与转写文本中学习上下文,因此倾向于将 OOV 词误识别为词表中的词。本文中,我们利用仅以转写文本训练、具有更优语言信息以检测 OOV 词的外部语言模型(LM)来解决此问题。A2C 模型用于消解这些 OOV 词。实验评估表明,外部 LM 不仅具有减少错误的作用,还增加了检测到的 OOV 词数量,且所提方法在英语会话和日语讲座语料库上显著提升了性能,尤其在域外场景下。我们还研究了 A2W 模型词表大小及训练 LM 的数据量的影响。此外,我们的方法可在性能退化微小的情况下将词表大小缩减数倍。

关键词

引用

@article{arxiv.1909.09993,
  title  = {Improving OOV Detection and Resolution with External Language Models in Acoustic-to-Word ASR},
  author = {Hirofumi Inaguma and Masato Mimura and Shinsuke Sakai and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:1909.09993},
  year   = {2019}
}

备注

SLT2018