中文

GENEVA:面向数百种事件类型与论元角色的事件论元抽取泛化性基准

计算与语言 2023-06-02 v5

摘要

近期事件论元抽取(EAE)的研究聚焦于提升模型泛化能力,以适应新事件与新领域。然而,ACE和ERE等标准基准数据集涵盖的事件类型不足40种、以实体为中心的论元角色不足25种。有限的多样性与覆盖度阻碍了这些数据集充分评估EAE模型的泛化性。本文首先通过构建大规模且多样的EAE本体作出贡献。该本体通过利用EAE与语义角色标注(SRL)两项任务的相似性,将全面的SRL数据集FrameNet转化而来用于EAE。随后,我们收集详尽的人类专家标注以构建该本体,最终包含115种事件与220个论元角色,其中相当比例的角色并非实体。我们利用该本体进一步引入GENEVA,一个由四个测试套件组成的多样泛化性基准数据集,旨在评估模型处理有限数据及未见事件类型泛化的能力。我们对来自不同系列的六种EAE模型进行了基准测试。结果表明,由于非实体论元角色的存在,即便性能最佳的模型也仅能达到39%的F1分数,表明GENEVA为EAE泛化提供了新挑战。总体而言,我们大规模且多样的EAE本体有助于创建更全面的未来资源,而GENEVA是一个具有挑战性的基准数据集,鼓励进一步研究以提升EAE中的泛化性。代码与数据见 https://github.com/PlusLabNLP/GENEVA。

关键词

引用

@article{arxiv.2205.12505,
  title  = {GENEVA: Benchmarking Generalizability for Event Argument Extraction with Hundreds of Event Types and Argument Roles},
  author = {Tanmay Parekh and I-Hung Hsu and Kuan-Hao Huang and Kai-Wei Chang and Nanyun Peng},
  journal= {arXiv preprint arXiv:2205.12505},
  year   = {2023}
}

备注

Accepted at ACL 2023 main conference