反事实增强数据(不)有效性的研究
计算与语言
2022-03-17 v3 机器学习
摘要
尽管预训练语言模型在自然语言理解基准上取得了优异性能,它们往往依赖虚假相关性,并对分布外(OOD)数据泛化不佳。近期工作探索使用反事实增强数据(CAD)——通过对样本最小扰动以翻转真实标签生成的数据——来识别在分布偏移下不变的稳健特征。然而,使用 CAD 进行 OOD 泛化的实证结果喜忧参半。为解释这一差异,我们从线性高斯模型中汲取见解,并展示了 CAD 的缺陷。具体而言,我们表明:(a) 尽管 CAD 能有效识别稳健特征,但可能阻碍模型学习未扰动的稳健特征;(b) CAD 可能加剧数据中已有的虚假相关性。在两个众包 CAD 数据集上,我们的结果表明扰动多样性的缺乏限制了其在 OOD 泛化上的有效性,呼吁创新的众包程序以引出样本的多样化扰动。
引用
@article{arxiv.2107.00753,
title = {An Investigation of the (In)effectiveness of Counterfactually Augmented Data},
author = {Nitish Joshi and He He},
journal= {arXiv preprint arXiv:2107.00753},
year = {2022}
}
备注
ACL 2022 (v3: Toy theoretical example updated)