ANCHOR:将对抗训练与硬性监督对比学习集成用于稳健表征学习
计算机视觉与模式识别
2025-11-03 v1
摘要
神经网络已改变机器解读世界的方式。它们的核心在于通过跟随梯度,逐步调整参数,直至识别数据中最具判别性的模式。这个过程赋予了它们的力量,也敞开了隐蔽缺陷的大门。帮助模型学习的梯度本身也可被用于产生小小、难以察觉的扰动,从而导致模型完全改变其决策。此类扰动称为对抗攻击。这些攻击通过在图像上添加微小、难以察觉的变化来利用这一漏洞——这些变化对人类眼睛而言几乎完全相同,却导致模型作出错误预测。在本工作中,我们提出了一种用于优化鲁棒性的对抗训练对比硬性挖掘框架(ANCHOR),该框架利用监督对比学习的强大能力,并结合显式硬正样本挖掘,使模型能够学习图像表征,使得图像、其增强版本及其扰动版本的嵌入在同一类别的其他图像嵌入之间聚类,同时与其他类别的图像分离。这一对齐有助于模型关注稳定、有意义的模式,而非脆弱的梯度线索。在 CIFAR-10 上,我们的方法在 PGD-20(epsilon = 0.031)下的干净准确率和鲁棒准确率均取得令人瞩目的成绩,超越了标准对抗训练方法。我们的结果表明,结合对抗性指导与硬性挖掘的对比监督有助于模型学习更结构化和稳健的表征,缩小了准确率与鲁棒性之间的差距。
引用
@article{arxiv.2510.27599,
title = {ANCHOR: Integrating Adversarial Training with Hard-mined Supervised Contrastive Learning for Robust Representation Learning},
author = {Samarup Bhattacharya and Anubhab Bhattacharya and Abir Chakraborty},
journal= {arXiv preprint arXiv:2510.27599},
year = {2025}
}
备注
11 pages, 1 figure