中文

JMA:一种生成近乎最优定向对抗样本的通用算法

机器学习 2025-08-18 v2 人工智能 计算机视觉与模式识别

摘要

迄今为止,大多数针对深度学习分类器生成定向对抗样本的方法高度次优,通常依赖于增加目标类别的似然,从而隐含地关注独热编码设置。本文提出了一种更通用、理论上合理的定向攻击方法,该方法通过最小化雅可比诱导的马氏距离项,考虑了在输入空间中移动输入样本潜在空间表示到给定方向所需的努力。通过利用Wolfe对偶定理求解该最小化问题,将问题简化为求解非负最小二乘(NNLS)问题。所提出的算法(称为JMA)为Szegedy等人最初引入的对抗样本问题的线性化版本提供了最优解。实验结果证实了所提出攻击的通用性,证明其在多种输出编码方案下均有效。值得注意的是,JMA在多标签分类场景中也有效,能够在复杂的多标签分类场景中诱导多达一半标签的定向修改,这是迄今为止所有攻击方法都无法实现的能力。此外,JMA只需很少的迭代次数,因此比现有方法更高效。

关键词

引用

@article{arxiv.2401.01199,
  title  = {JMA: a General Algorithm to Craft Nearly Optimal Targeted Adversarial Example},
  author = {Benedetta Tondi and Wei Guo and Niccolò Pancino and Mauro Barni},
  journal= {arXiv preprint arXiv:2401.01199},
  year   = {2025}
}