当多反少:引入额外数据集会因引入虚假相关性而损害性能
机器学习
2023-08-09 v1 计算机视觉与模式识别
摘要
在机器学习中,引入更多数据常被视为改进模型性能的可靠策略;本工作挑战了这一观念,证明在许多情况下添加外部数据集反而会损害所得模型的性能。在一项跨越四个不同开源胸部 X 光数据集与 9 个不同标签组合的大规模实证研究中,我们表明在 43% 的设置下,在两个医院数据上训练的模型,其针对两医院的最坏组准确率反而低于仅在单一医院数据上训练的模型。这一令人惊讶的结果即便在新增医院使训练分布更接近于测试分布时仍会发生。我们解释该现象源于疾病与医院之间因医院特异性图像伪影而出现的虚假相关性。我们强调了在多数据集上训练时所面临的权衡:一方面是可观的额外数据收益,另一方面是引入虚假相关性的隐性代价。在某些情况下,对数据集进行平衡可消除虚假相关性并改善性能,但这并非总是有效策略。我们将结果置于有关虚假相关性的文献背景下,以帮助解释这些结果。我们的实验凸显了在为机器学习模型选择训练数据时须保持谨慎的重要性,尤其在存在如医学影像中虚假相关性风险的场景中。所述风险凸显了未来研究与实践中仔细选择数据与评估模型的必要性。
引用
@article{arxiv.2308.04431,
title = {When More is Less: Incorporating Additional Datasets Can Hurt Performance By Introducing Spurious Correlations},
author = {Rhys Compton and Lily Zhang and Aahlad Puli and Rajesh Ranganath},
journal= {arXiv preprint arXiv:2308.04431},
year = {2023}
}
备注
Accepted at MLHC 2023