NatADiff:用于自然对抗扩散的对抗边界引导
机器学习
2026-03-04 v2
摘要
对抗样本利用深度学习模型所“学习”流形的不规则性来导致错误分类。对这些对抗样本的研究提供了对模型用于分类输入特征的洞察,这可被利用来提高抵御未来攻击的鲁棒性。然而,现有文献大多关注受约束的对抗样本,这不能准确反映现实场景中遇到的测试时错误。为了解决这个问题,我们提出了“NatADiff”,一种利用去噪扩散生成自然对抗样本的对抗采样方案。我们的方法基于这样一个观察:自然对抗样本通常包含来自对抗类别的结构元素。深度学习模型可以利用这些结构元素走分类过程的捷径,而不是学习真正区分类别。为了利用这种行为,我们将扩散轨迹引导至真实类别和对抗类别的交集,将时间旅行采样与增强的分类器引导相结合,在保持图像保真度的同时增强攻击可迁移性。我们的方法实现了与当前最先进技术相当的攻击成功率,同时在跨模型架构上表现出显著更高的可迁移性,并且通过FID衡量,与自然测试时错误更好地对齐。这些结果表明,NatADiff生成的对抗样本不仅能在模型间更有效地迁移,而且更忠实地类似于自然发生的测试时错误。
引用
@article{arxiv.2505.20934,
title = {NatADiff: Adversarial Boundary Guidance for Natural Adversarial Diffusion},
author = {Max Collins and Jordan Vice and Tim French and Ajmal Mian},
journal= {arXiv preprint arXiv:2505.20934},
year = {2026}
}
备注
10 pages, 3 figures, 2 tables