中文

释放反事实增强数据在分布外泛化中的潜力

计算与语言 2023-10-11 v1 人工智能 机器学习

摘要

反事实增强数据(CAD)——对句子进行最小编辑以翻转相应标签——有潜力提升语言模型的分布外(OOD)泛化能力,因为CAD促使语言模型利用与领域无关的因果特征并排除虚假关联。然而,CAD在OOD泛化上的实证结果并未如预期般高效。在本研究中,我们将这种低效归因于CAD引起的短视现象:语言模型仅关注增强操作中被编辑的因果特征,而排除其他未被编辑的因果特征。因此,CAD的潜力未被充分挖掘。为解决此问题,我们从费舍尔线性判别的角度在特征空间中分析短视现象,随后基于CAD的结构特性(数据集级与句子级)引入两个额外约束,以帮助语言模型在CAD中提取更完整的因果特征,从而缓解短视现象并提升OOD泛化能力。我们在情感分析与自然语言推理两项任务上评估了我们的方法,实验结果表明该方法能够释放CAD的潜力,并将语言模型的OOD泛化性能提升1.0%至5.9%。

关键词

引用

@article{arxiv.2310.06666,
  title  = {Unlock the Potential of Counterfactually-Augmented Data in Out-Of-Distribution Generalization},
  author = {Caoyun Fan and Wenqing Chen and Jidong Tian and Yitian Li and Hao He and Yaohui Jin},
  journal= {arXiv preprint arXiv:2310.06666},
  year   = {2023}
}

备注

Expert Systems With Applications 2023. arXiv admin note: text overlap with arXiv:2302.09345