中文

SCENE:用于外推至负例的自标注反事实方法

计算与语言 2024-01-30 v3

摘要

检测负例(如非蕴含关系、不可回答问题以及虚假声明)是许多自然语言理解任务中重要且具有挑战性的方面。尽管人工收集具有挑战性的负例可帮助模型检测它们,但该方法成本高且领域特定。在本工作中,我们提出用于外推至负例的自标注反事实方法(SCENE),一种自动合成训练数据的方法,可大幅提升模型检测具有挑战性负例的能力。与为已有标签合成新例子的标准数据增强不同,SCENE 可仅从正例零样本合成负例。给定一个正例,SCENE 用掩码填充模型对其进行扰动,然后基于自训练启发式规则判断所得例子是否为负例。在仅使用可回答训练例子的情况下,与在 SQuAD 2.0 上训练的模型相比,SCENE 可缩小 SQuAD 2.0(其一半评估例子不可回答)上 69.6% 的性能差距。我们的方法也扩展到布尔问答和识别文本蕴含,并改善了从 SQuAD 到 ACE-whQA(一个域外抽取式 QA 基准)的泛化能力。

关键词

引用

@article{arxiv.2305.07984,
  title  = {SCENE: Self-Labeled Counterfactuals for Extrapolating to Negative Examples},
  author = {Deqing Fu and Ameya Godbole and Robin Jia},
  journal= {arXiv preprint arXiv:2305.07984},
  year   = {2024}
}

备注

EMNLP 2023