机器学习中虚假相关的语用框架:解读其如何及为何重要
机器学习
2026-05-05 v5 人工智能
摘要
从数据中学习相关关系构成了当今机器学习(ML)与人工智能研究的基础。尽管当代方法能够自动发现复杂模式,但当捕获到非预期相关关系时,它们容易失效。这一脆弱性激发了学术界对虚假性(spuriousness)的日益关注,虚假性通常被视为对模型性能、公平性和鲁棒性的威胁。在本文中,我们追溯了虚假性的传统统计定义——即由巧合或混淆产生的非因果关系——的偏离,以考察其在 ML 研究中含义的协商过程。研究者并非仅依赖形式化定义,而是通过我们称之为语用框架(pragmatic frames)的方式评估虚假性:基于相关关系在实践中所起的作用——它如何影响模型行为、支持或阻碍任务性能,或是否符合更广泛的规范目标。通过对 ML 文献的广泛调研,我们识别出四种此类框架:相关性(模型应使用与任务相关的相关关系)、泛化性(模型应使用能泛化到未见数据的相关关系)、类人性(模型应使用人类执行相同任务时会使用的相关关系)和有害性(模型应使用在社会或伦理上无害的相关关系)。这些表征揭示,相关关系的可取性并非固定的统计属性,而是受技术、认识论和伦理考量影响的情境性判断。通过考察一个基础的 ML 难题在研究文献中如何被问题化,我们为关于虚假性等技术概念如何通过偶然实践被定义和操作的更广泛讨论做出了贡献。
引用
@article{arxiv.2411.04696,
title = {The Pragmatic Frames of Spurious Correlations in Machine Learning: Interpreting How and Why They Matter},
author = {Samuel J. Bell and Skyler Wang},
journal= {arXiv preprint arXiv:2411.04696},
year = {2026}
}