UniCausal:面向因果文本挖掘的统一基准与语料库
计算与语言
2023-04-17 v2
摘要
当前的因果文本挖掘数据集在目标、数据覆盖范围和标注方案上各不相同。这些不一致的工作阻碍了建模能力的提升和模型性能的公平比较。此外,很少有数据集包含端到端因果关系抽取所需的因果片段标注。为解决这些问题,我们提出了 UniCausal,一个面向因果文本挖掘的统一基准,涵盖三个任务:(I) 因果序列分类,(II) 因果片段检测,以及 (III) 因果对分类。我们整合并对齐了六个高质量(主要为人工标注)语料库的标注,最终分别得到 58,720、12,144 和 69,165 个样本。由于因果性的定义可能具有主观性,我们的框架被设计为允许研究者使用部分或全部数据集与任务。为建立初始基准,我们对每个任务微调了 BERT 预训练语言模型,分别取得了 70.10% 的二分类 F1、52.42% 的宏 F1 和 84.68% 的二分类 F1 分数。
引用
@article{arxiv.2208.09163,
title = {UniCausal: Unified Benchmark and Repository for Causal Text Mining},
author = {Fiona Anting Tan and Xinyu Zuo and See-Kiong Ng},
journal= {arXiv preprint arXiv:2208.09163},
year = {2023}
}
备注
15 pages include References