当分布偏移发生时——混杂因素是罪魁祸首
机器学习
2025-05-28 v1
摘要
分布偏移引入了不确定性,破坏了机器学习模型的鲁棒性和泛化能力。传统观点认为,学习因果不变表示可以增强对此类偏移的鲁棒性,但最近的实证研究提出了一个反直觉的发现: 经验风险最小化(ERM)可以媲美甚至超越最先进的分布外(OOD)泛化方法, 其 OOD 泛化性能在利用所有可用协变量(而不仅仅是因果变量)时会得到提升。基于实证和理论证据,我们将这一现象归因于隐藏混杂因素。隐藏混杂因素的偏移导致数据分布发生变化,违反了现有 OOD 泛化方法通常做出的假设。在这些条件下,我们证明有效的泛化需要学习特定于环境的关系,而不是仅仅依赖不变关系。此外,我们表明,用隐藏混杂因素的代理变量增强的模型可以缓解隐藏混杂因素偏移带来的挑战。这些发现为设计鲁棒的 OOD 泛化算法和原则性的协变量选择策略提供了新的理论见解和实践指导。
引用
@article{arxiv.2505.21422,
title = {When Shift Happens - Confounding Is to Blame},
author = {Abbavaram Gowtham Reddy and Celia Rubio-Madrigal and Rebekka Burkholz and Krikamol Muandet},
journal= {arXiv preprint arXiv:2505.21422},
year = {2025}
}