中文

NatADiff:用于自然对抗扩散的对抗边界引导

机器学习 2026-03-04 v2

摘要

对抗样本利用深度学习模型所“学习”流形的不规则性来导致错误分类。对这些对抗样本的研究提供了对模型用于分类输入特征的洞察,这可被利用来提高抵御未来攻击的鲁棒性。然而,现有文献大多关注受约束的对抗样本,这不能准确反映现实场景中遇到的测试时错误。为了解决这个问题,我们提出了“NatADiff”,一种利用去噪扩散生成自然对抗样本的对抗采样方案。我们的方法基于这样一个观察:自然对抗样本通常包含来自对抗类别的结构元素。深度学习模型可以利用这些结构元素走分类过程的捷径,而不是学习真正区分类别。为了利用这种行为,我们将扩散轨迹引导至真实类别和对抗类别的交集,将时间旅行采样与增强的分类器引导相结合,在保持图像保真度的同时增强攻击可迁移性。我们的方法实现了与当前最先进技术相当的攻击成功率,同时在跨模型架构上表现出显著更高的可迁移性,并且通过FID衡量,与自然测试时错误更好地对齐。这些结果表明,NatADiff生成的对抗样本不仅能在模型间更有效地迁移,而且更忠实地类似于自然发生的测试时错误。

关键词

引用

@article{arxiv.2505.20934,
  title  = {NatADiff: Adversarial Boundary Guidance for Natural Adversarial Diffusion},
  author = {Max Collins and Jordan Vice and Tim French and Ajmal Mian},
  journal= {arXiv preprint arXiv:2505.20934},
  year   = {2026}
}

备注

10 pages, 3 figures, 2 tables