中文

理解对抗性迁移:数据空间攻击为何成功,而表示空间攻击却失败

机器学习 2025-10-06 v2 人工智能

摘要

对抗鲁棒性领域长期以来 established that 对抗性示例可以在图像分类器之间成功迁移,文本作恶也能在语言模型之间成功迁移。然而,近期的两项研究报告称无法在视觉语言模型之间成功迁移图像作恶。为解释这一显著差异,我们提出了一种关于机器学习模型攻击可迁移性的根本性区分:数据空间中的攻击可以迁移,而表示空间中的攻击则不行(至少需要对表示进行几何对齐)。我们随后在四个不同设置下提供了该假设的理论和实证证据。首先,我们在两个网络通过不同表示计算相同输入-输出映射的简单设置中数学证明了这一区分。其次,我们构造针对图像分类器的表示空间攻击,成功程度与著名的数据空间攻击相当,但无法迁移。其次,我们构造针对语言模型的表示空间攻击,成功jailbreak被攻击模型,但同样无法迁移。最后,我们构造针对视觉语言模型的数据空间攻击,成功迁移到新的视觉语言模型,并展示在视觉语言模型的潜在几何在后投影空间足够对齐时,表示空间攻击可以迁移。我们的工作揭示了对抗性迁移并非所有攻击的固有属性,而是取决于其操作领域——共享的数据空间 versus 模型唯一的表示空间,这对构建更鲁棒的模型具有重要意义。

关键词

引用

@article{arxiv.2510.01494,
  title  = {Understanding Adversarial Transfer: Why Representation-Space Attacks Fail Where Data-Space Attacks Succeed},
  author = {Isha Gupta and Rylan Schaeffer and Joshua Kazdan and Ken Ziyu Liu and Sanmi Koyejo},
  journal= {arXiv preprint arXiv:2510.01494},
  year   = {2025}
}