核集选取对虚假关联及群体鲁棒性的影响
机器学习
2025-10-22 v2 计算机视觉与模式识别
摘要
核集选取方法在保持模型性能的前提下,显著缩小训练数据规模,展现出数据高效机器学习的潜力。然而,由于诸多数据集存在偏见,导致模型学习虚假关联而非因果特征,亟需探究数据规约方法如何影响这些偏见的持续性、放大性或缓解性。本文首次对数据选取对所选核集虚假偏置水平及下游模型鲁棒性的影响进行全面分析。我们构建了横跨十个虚假关联基准、五种评分指标(用于刻画样本重要性/难度)、五种数据选取策略,并覆盖广泛的核集规模范围的实验设置。通过此,我们揭示了样本难度与偏置对齐性、数据偏置与模型鲁棒性之间存在诸多非平凡的相互作用规律。例如,我们发现基于嵌入表示的样本特征评分进行核集选取,相较于基于学习动力学特征的选取方式,更不易无意中放大偏置。更重要的是,我们的分析表明,尽管某些核集选取方法可通过优先选择困难样本实现较低的偏置水平,但这并不必然保证下游模型的鲁棒性。
引用
@article{arxiv.2507.11690,
title = {The Impact of Coreset Selection on Spurious Correlations and Group Robustness},
author = {Amaya Dharmasiri and William Yang and Polina Kirichenko and Lydia Liu and Olga Russakovsky},
journal= {arXiv preprint arXiv:2507.11690},
year = {2025}
}
备注
10 pages, 9 additional pages for Appendix