中文

因果新闻语料库:标注新闻事件句中的因果关系

计算与语言 2022-04-26 v1

摘要

尽管理解因果关系十分重要,但关注因果关系的语料库仍然有限。现有事件因果标注规范与更侧重语言学的传统因果语料库之间存在差异。许多规范仅局限于包含显式关系或基于从句的论元。因此,我们提出了一种解决这些问题的事件因果标注模式。我们标注了来自抗议事件新闻的 3,559 个事件句,并标记其是否包含因果关系。我们的语料库被称为因果新闻语料库(Causal News Corpus,CNC)。基于最先进预训练语言模型的神经网络在测试集上取得了 81.20% 的 F1 分数,在 5 折交叉验证中取得了 83.46%。CNC 可在两个外部语料库上迁移:CausalTimeBank(CTB)和 Penn Discourse Treebank(PDTB)。利用这些外部数据集分别进行训练,我们在无需额外微调的情况下于 CNC 测试集上取得了最高约 64% 的 F1。CNC 也作为这两个外部语料库的有效训练和预训练数据集。最后,我们通过众包标注实验向非专业人员展示了本任务的难度。我们的标注语料库已公开,为因果文本挖掘研究者提供了宝贵资源。

关键词

引用

@article{arxiv.2204.11714,
  title  = {The Causal News Corpus: Annotating Causal Relations in Event Sentences from News},
  author = {Fiona Anting Tan and Ali Hürriyetoğlu and Tommaso Caselli and Nelleke Oostdijk and Tadashi Nomoto and Hansi Hettiarachchi and Iqra Ameer and Onur Uca and Farhana Ferdousi Liza and Tiancheng Hu},
  journal= {arXiv preprint arXiv:2204.11714},
  year   = {2022}
}

备注

Accepted to LREC 2022