从英语语音中进行端到端命名实体识别
计算与语言
2020-05-25 v1 机器学习
声音
音频与语音处理
摘要
从文本中进行命名实体识别 (NER) 一直是一个被广泛研究的问题,通常从文本中提取语义信息。到目前为止,对语音 NER 的研究大多在两步流水线过程中进行,该过程首先在音频样本上应用自动语音识别 (ASR) 系统,然后将预测的转录文本传递给 NER 标注器。在这种情况下,由于两项任务未以端到端 (E2E) 方式联合优化,误差不会从一步传递到另一步。最近的研究证实,集成方法(例如 E2E ASR)优于顺序方法(例如基于音素的 ASR)。在本文中,我们引入了首个公开可用的英语语音 NER 标注数据集,并提出了一种联合优化 ASR 和 NER 标注器组件的 E2E 方法。实验结果表明,所提出的 E2E 方法优于经典的两步方法。我们还讨论了如何利用语音 NER 来处理 ASR 系统中的词外 (OOV) 词。
引用
@article{arxiv.2005.11184,
title = {End-to-end Named Entity Recognition from English Speech},
author = {Hemant Yadav and Sreyan Ghosh and Yi Yu and Rajiv Ratn Shah},
journal= {arXiv preprint arXiv:2005.11184},
year = {2020}
}
备注
submitted to Interspeech-2020