中文

聪明马汉斯的幻象:机器学习中虚假相关性的全面综述

机器学习 2025-10-02 v4

摘要

早在 20 世纪初,一匹名叫汉斯的马在德国的展览中似乎能执行算术和其他智力任务,而实际上它完全依赖于人类训练师肢体语言中的无意识线索。现代机器学习模型也不例外。已知这些模型对输入的非本质特征(如背景、纹理和次要对象)与相应标签之间的虚假相关性很敏感。这些特征及其与标签的相关性被称为“虚假的”,因为它们往往随着真实世界数据分布的偏移而改变,这会对模型的泛化能力和鲁棒性产生负面影响。在本文中,我们对这一新兴问题进行了全面综述,并对现有解决机器学习模型中虚假相关性的最先进方法进行了细粒度分类。此外,我们总结了现有的数据集、基准和指标,以促进未来的研究。本文最后讨论了生成式 AI 时代的广泛影响、最新进展和未来挑战,旨在为机器学习社区相关领域的研究人员提供有价值的见解。

关键词

引用

@article{arxiv.2402.12715,
  title  = {The Clever Hans Mirage: A Comprehensive Survey on Spurious Correlations in Machine Learning},
  author = {Wenqian Ye and Luyang Jiang and Eric Xie and Guangtao Zheng and Yunsheng Ma and Xu Cao and Dongliang Guo and Daiqing Qi and Zeyu He and Yijun Tian and Megan Coffee and Zhe Zeng and Sheng Li and Ting-hao and Huang and Ziran Wang and James M. Rehg and Henry Kautz and Aidong Zhang},
  journal= {arXiv preprint arXiv:2402.12715},
  year   = {2025}
}

备注

Version 3 with Major Revision; Github Link: https://github.com/wenqian-ye/Awesome-Spurious-Correlations