中文

面向事件论元抽取的文本蕴含:基于多源学习的零样本与少样本方法

计算与语言 2022-05-04 v1

摘要

近期研究表明,关系抽取(RE)等 NLP 任务可利用述谓化改写为文本蕴含任务,并借助预训练蕴含模型在零样本和少样本设定下取得强劲性能。当前 RE 数据集中的关系易于述谓化,这令人怀疑蕴含在更复杂任务中是否同样有效。本工作中我们表明,蕴含在事件论元抽取(EAE)中同样有效:在 ACE 和 WikiEvents 中分别仅需 50% 和 20% 的人工标注量,即可达到全量训练下的同等性能。更重要的是,我们将 EAE 改写为蕴含任务缓解了对于模式(schema)的依赖,而这一依赖一直是跨领域标注迁移的障碍。得益于蕴含,ACE 与 WikiEvents 间的多源迁移进一步将标注量降至全量训练无迁移时的 10% 和 5%(分别对应)。我们的分析显示,良好结果的关键在于使用多个蕴含数据集来预训练蕴含模型。与先前方法类似,我们的方法所需人工述谓化工作量很小:每类事件论元仅需不到 15 分钟,且不同专业水平的用户均可取得相近结果。

关键词

引用

@article{arxiv.2205.01376,
  title  = {Textual Entailment for Event Argument Extraction: Zero- and Few-Shot with Multi-Source Learning},
  author = {Oscar Sainz and Itziar Gonzalez-Dios and Oier Lopez de Lacalle and Bonan Min and Eneko Agirre},
  journal= {arXiv preprint arXiv:2205.01376},
  year   = {2022}
}

备注

Accepted as Findings of NAACL2022