中文

从英语语音中进行端到端命名实体识别

计算与语言 2020-05-25 v1 机器学习 声音 音频与语音处理

摘要

从文本中进行命名实体识别 (NER) 一直是一个被广泛研究的问题,通常从文本中提取语义信息。到目前为止,对语音 NER 的研究大多在两步流水线过程中进行,该过程首先在音频样本上应用自动语音识别 (ASR) 系统,然后将预测的转录文本传递给 NER 标注器。在这种情况下,由于两项任务未以端到端 (E2E) 方式联合优化,误差不会从一步传递到另一步。最近的研究证实,集成方法(例如 E2E ASR)优于顺序方法(例如基于音素的 ASR)。在本文中,我们引入了首个公开可用的英语语音 NER 标注数据集,并提出了一种联合优化 ASR 和 NER 标注器组件的 E2E 方法。实验结果表明,所提出的 E2E 方法优于经典的两步方法。我们还讨论了如何利用语音 NER 来处理 ASR 系统中的词外 (OOV) 词。

关键词

引用

@article{arxiv.2005.11184,
  title  = {End-to-end Named Entity Recognition from English Speech},
  author = {Hemant Yadav and Sreyan Ghosh and Yi Yu and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2005.11184},
  year   = {2020}
}

备注

submitted to Interspeech-2020