中文

提升语言模型的分布外泛化能力:反事实增强数据并不足够

计算与语言 2023-02-21 v1

摘要

反事实增强数据(CAD)有潜力提升语言模型的分布外(OOD)泛化能力,因为 CAD 能促使语言模型利用因果特征并排除虚假相关性。然而,基于 CAD 的 OOD 泛化实证结果并不如预期那样有效。在本文中,我们将这种低效归因于 CAD 引起的“短视现象”:语言模型只关注增强过程中被编辑的因果特征,而忽略了其他未被编辑的因果特征。因此,CAD 的潜力未能被充分挖掘。基于 CAD 的结构特性,我们设计了两个额外的约束条件,以帮助语言模型提取 CAD 中包含的更完整的因果特征,从而提升 OOD 泛化能力。我们在情感分析和自然语言推理两个任务上评估了我们的方法,实验结果表明,我们的方法能够释放 CAD 的潜力,并提升语言模型的 OOD 泛化能力。

关键词

引用

@article{arxiv.2302.09345,
  title  = {Improving the Out-Of-Distribution Generalization Capability of Language Models: Counterfactually-Augmented Data is not Enough},
  author = {Caoyun Fan and Wenqing Chen and Jidong Tian and Yitian Li and Hao He and Yaohui Jin},
  journal= {arXiv preprint arXiv:2302.09345},
  year   = {2023}
}

备注

ICASSP 2023