从不变表示到不变数据:通过噪声反事实匹配实现对虚假相关性的可证明鲁棒性
机器学习
2025-11-11 v2
摘要
从训练数据中学习虚假相关性的模型在新环境中部署时往往会失效。虽然许多方法旨在通过学习不变表示来解决这一问题,但它们的表现往往不如标准经验风险最小化(ERM)。我们提出了一种以数据为中心的替代方案,将重点从学习不变表示转向利用不变数据对——即应该具有相同预测结果的样本对。我们证明了某些反事实自然满足这一不变性。基于此,我们引入了噪声反事实匹配(NCM),这是一种简单的基于约束的方法,通过利用少量噪声反事实对来提高鲁棒性——改进了先前未明确考虑噪声的研究。对于线性因果模型,我们证明了 NCM 的测试域误差受限于其域内误差加上一个取决于反事实质量和多样性的项。在合成数据上的实验验证了我们的理论,我们还在真实世界数据集上展示了 NCM 的有效性。
引用
@article{arxiv.2505.24843,
title = {From Invariant Representations to Invariant Data: Provable Robustness to Spurious Correlations via Noisy Counterfactual Matching},
author = {Ruqi Bai and Yao Ji and Zeyu Zhou and David I. Inouye},
journal= {arXiv preprint arXiv:2505.24843},
year = {2025}
}