Title2Event:基于大规模中文标题数据集的开放事件抽取基准评测
计算与语言
2022-11-03 v1
摘要
事件抽取(EE)对新闻聚合和事件知识图谱构建等下游任务至关重要。现有大多数EE数据集手动定义固定事件类型并为每种类型设计特定模式,无法覆盖在线文本中涌现的多样化事件。此外,新闻标题作为事件提及的重要来源,在当前EE研究中尚未得到足够关注。本文提出Title2Event,一个大规模句子级基准数据集,用于不限制事件类型的开放事件抽取。Title2Event包含从中文网页收集的34个主题下逾42,000条新闻标题。据我们所知,它是目前最大的用于开放事件抽取的人工标注中文数据集。我们进一步在Title2Event上使用不同模型进行实验,表明标题的特性使其对事件抽取具有挑战性,凸显了针对该问题开展深入研究的重要性。数据集与基线代码发布于 https://open-event-hub.github.io/title2event。
引用
@article{arxiv.2211.00869,
title = {Title2Event: Benchmarking Open Event Extraction with a Large-scale Chinese Title Dataset},
author = {Haolin Deng and Yanan Zhang and Yangfan Zhang and Wangyang Ying and Changlong Yu and Jun Gao and Wei Wang and Xiaoling Bai and Nan Yang and Jin Ma and Xiang Chen and Tianhua Zhou},
journal= {arXiv preprint arXiv:2211.00869},
year = {2022}
}
备注
EMNLP 2022