中文

面向鲁棒学习的隐式反事实数据增强

机器学习 2025-07-11 v4

摘要

机器学习模型易于捕捉非因果属性与类别之间的虚假关联,而反事实数据增强是打破这些虚假关联的一个有前景的方向。然而,显式生成反事实数据存在挑战,且将增强数据纳入训练过程会降低训练效率。本研究提出一种隐式反事实数据增强(ICDA)方法,以消除虚假关联并做出稳定预测。具体而言,首先,开发了一种新颖的样本级增强策略,为每个样本生成具有不同增强强度的语义上和反事实上有意义的深度特征。其次,当增强样本数量趋于无穷时,我们在增强特征集上推导出一个易于计算的替代损失。第三,提出了两种具体方案,包括直接量化和元学习,以推导鲁棒损失的关键参数。此外,从正则化视角对 ICDA 进行了解释,揭示了其在类和样本层面上提升类内紧致性和扩大间隔的能力。我们在涵盖图像和文本数据集的多种有偏学习场景下进行了大量实验,表明 ICDA 持续增强了流行网络的泛化性和鲁棒性。

关键词

引用

@article{arxiv.2304.13431,
  title  = {Implicit Counterfactual Data Augmentation for Robust Learning},
  author = {Xiaoling Zhou and Ou Wu and Michael K. Ng},
  journal= {arXiv preprint arXiv:2304.13431},
  year   = {2025}
}

备注

33 pages, 10 figures