中文

多叙事语义重叠任务:评估与基准

计算与语言 2022-01-17 v1 人工智能

摘要

在本文中,我们引入一项重要但相对未被探索的 NLP 任务,称为多叙事语义重叠(MNSO),其需要生成多个备选叙事的语义重叠。由于该任务尚无现成基准数据集,我们通过从网络爬取 2,925 对叙事来创建一个,随后经过繁琐过程聘请人类标注者手动创建 411 个不同的真值语义重叠。作为评估这一新颖任务的方式,我们首先通过借用文本摘要文献中流行的 ROUGE 指标进行系统研究,发现 ROUGE 不适合我们的任务。随后,我们进行了进一步的人类标注/验证以创建 200 个文档级和 1,518 个句子级真值标签,这有助于我们制定一种新的精确率-召回率风格评估指标,称为 SEM-F1(语义 F1)。实验结果表明,与 ROUGE 指标相比,所提出的 SEM-F1 指标与人类判断具有更高的相关性,并且具有更高的一致性评分者间协议。

关键词

引用

@article{arxiv.2201.05294,
  title  = {Multi-Narrative Semantic Overlap Task: Evaluation and Benchmark},
  author = {Naman Bansal and Mousumi Akter and Shubhra Kanti Karmaker Santu},
  journal= {arXiv preprint arXiv:2201.05294},
  year   = {2022}
}