无需词元级监督的端到端信息抽取
计算与语言
2017-07-18 v1
摘要
大多数最先进的信息抽取方法依赖于词元级标签来查找文本中的感兴趣区域。不幸的是,这些标签的创建耗时且成本高昂,因此许多现实生活中的 IE 任务无法获得这些标签。更糟糕的是,词元级标签通常不是期望的输出,而只是一个中间步骤。端到端 (E2E) 模型以原始文本为输入并直接产生期望的输出,无需依赖词元级标签。我们提出了一种基于指针网络的 E2E 模型,该模型可以直接在原始输入和输出文本对上进行训练。我们在 ATIS 数据集、MIT 餐厅语料库和 MIT 电影语料库上评估了我们的模型,并与确实使用词元级标签的神经基线进行了比较。我们取得了具有竞争力的结果,与基线相差几个百分点,表明了无需词元级标签的 E2E 信息抽取的可行性。这开启了新的可能性,因为对于许多目前由人工抽取器处理的任务,原始输入和输出数据是可用的,但词元级标签却不可用。
引用
@article{arxiv.1707.04913,
title = {End-to-End Information Extraction without Token-Level Supervision},
author = {Rasmus Berg Palm and Dirk Hovy and Florian Laws and Ole Winther},
journal= {arXiv preprint arXiv:1707.04913},
year = {2017}
}
备注
http://speechnlp.github.io/2017 @ EMNLP 2017