一个用于开放领域程序性文本中实体追踪的数据集
计算与语言
2020-11-17 v1
摘要
我们提出了首个通过使用不受限(开放)词汇表来追踪任意领域程序性文本中状态变化的数据集。例如,在描述用土豆除雾的文本中,汽车车窗可能在起雾、粘稠、不透明和清晰之间转换。该任务的先前表述提供文本与所涉实体,并仅针对一小部分预定义属性(如位置)询问这些实体如何变化,限制了其保真度。我们的解决方案是一种新任务表述:仅以程序性文本作为输入,任务是为每一步生成一组状态变化元组(实体、属性、前状态、后状态),其中实体、属性与状态值必须从开放词汇表中预测。利用众包,我们创建了 OPENPI1,一个高质量(经人工判定覆盖率为 91.5% 且完全审核)、大规模的数据集,包含来自 WikiHow.com 的 810 个真实程序性段落中 4,050 个句子的 29,928 个状态变化。该任务上当前最先进的生成模型基于 BLEU 指标取得 16.1% 的 F1,为新颖模型架构留下了充足空间。
引用
@article{arxiv.2011.08092,
title = {A Dataset for Tracking Entities in Open Domain Procedural Text},
author = {Niket Tandon and Keisuke Sakaguchi and Bhavana Dalvi Mishra and Dheeraj Rajagopal and Peter Clark and Michal Guerquin and Kyle Richardson and Eduard Hovy},
journal= {arXiv preprint arXiv:2011.08092},
year = {2020}
}
备注
To appear in EMNLP 2020