通过生成对抗样本来缓解图像分类器中的聪明汉子策略
机器学习
2026-05-07 v1
摘要
深度学习模型仍然容易受到虚假关联的威胁,导致所谓的聪明汉子预测器,从而削弱大规模基础模型和自监督模型的鲁棒性。组分布鲁棒方法,如深度特征重加权(Deep Feature Reweighting, DFR),依赖显式的组标签来提高欠 représent 的子组,但面临关键限制:(1)组标签常常不可得;(2)组内样本数量较少,难以覆盖子组分布;(3)当多个虚假关联将数据碎片化为更小的子组时,性能会急剧下降。我们提出了对抗知识蒸馏(Counterfactual Knowledge Distillation, CFKD)框架,通过生成多样化的对抗样本,使人类标注员能够通过知识蒸馏步骤高效地探索和纠正模型的决策边界。与 DFR 不同,我们的方法不仅重加权欠 représent 的子组,还通过新增数据点来丰富这些子组。 our 方法不需要任何混杂器标签,能够有效扩展到多个混杂器,并且实现跨组的均衡泛化。我们在五个数据集上展示了 CFKD 的有效性,涵盖合成任务至工业应用,特别是在数据稀缺且虚假关联显著的情形下取得显著提升。此外,我们提供了关于所选对抗解释器和教师模型影响的消融研究,突出它们对鲁棒性的影响。
引用
@article{arxiv.2510.17524,
title = {Mitigating Clever Hans Strategies in Image Classifiers through Generating Counterexamples},
author = {Sidney Bender and Ole Delzer and Jan Herrmann and Heike Antje Marxfeld and Klaus-Robert Müller and Grégoire Montavon},
journal= {arXiv preprint arXiv:2510.17524},
year = {2026}
}