中文

OntoGUM:在 12 种以上体裁上评估上下文 SOTA 共指消解

计算与语言 2021-06-04 v2

摘要

SOTA 共指消解在 OntoNotes 基准测试上取得了越来越高的分数。然而,由于缺乏遵循相同方案且涵盖更多体裁的可比数据,很难评估其对开放领域数据的泛化能力。本文提供了一个数据集和全面的评估,表明最新的基于神经语言模型端到端系统在跨领域时性能会大幅下降。我们公开发布了一个名为 OntoGUM 的类 OntoNotes 共指数据集,该数据集使用确定性规则从覆盖 12 种体裁的英语语料库 GUM 转换而来,并对其进行了评估。得益于 GUM 中丰富的句法和语篇标注,我们能够创建遵循 OntoNotes 指南的最大的人工标注共指语料库,并且是首个评估与 OntoNotes 方案一致性的语料库。跨 12 种体裁的域外评估显示,确定性和深度学习系统的性能均下降了近 15-20%,表明现有共指消解模型缺乏泛化能力或存在隐蔽过拟合。

关键词

引用

@article{arxiv.2106.00933,
  title  = {OntoGUM: Evaluating Contextualized SOTA Coreference Resolution on 12 More Genres},
  author = {Yilun Zhu and Sameer Pradhan and Amir Zeldes},
  journal= {arXiv preprint arXiv:2106.00933},
  year   = {2021}
}

备注

ACL 2021