中文

易路:基于样本难易性的核心集选择

机器学习 2025-10-14 v1 计算机视觉与模式识别

摘要

从数据导向视角设计对抗鲁棒模型需要理解哪些输入样本对学习鲁棒特征最关键。虽然核心集选择提供了在子集上高效训练的机制,但当前算法为干净准确率设计,难以保留鲁棒性。为此,我们提出一种框架将样本的对抗脆弱性与其难易性关联起来,其中我们使用训练期间的平均输入梯度范数(AIGN)来量化难易性。我们证明,难样本(AIGN 较大)更易受对抗攻击且位于决策边界更近的区域。利用这一洞见,我们提出 EasyCore—a 一种仅保留 AIGN 较小样本的核心集选择算法。我们实证表明,使用 EasyCore 选择的数据训练的模型在标准训练和对抗训练两种情况下,都显著优于现有核心集方法。由于 AIGN 是模型无关的数据集属性,EasyCore 是一种高效且广泛适用的数据导向方法,可提高对抗鲁棒性。我们展示,EasyCore 在标准训练下可实现对抗准确率提升最高达 7%,在 TRADES 对抗训练下提升最高达 5%。

关键词

引用

@article{arxiv.2510.11018,
  title  = {The Easy Path to Robustness: Coreset Selection using Sample Hardness},
  author = {Pranav Ramesh and Arjun Roy and Deepak Ravikumar and Kaushik Roy and Gopalakrishnan Srinivasan},
  journal= {arXiv preprint arXiv:2510.11018},
  year   = {2025}
}