跨模态对抗扩散:面向文本、视觉与视觉-语言模型的攻击、防御及评估融合综述
密码学与安全
2026-06-25 v1 计算与语言
摘要
AI 系统的对抗评估已沿四条大体脱节的轨迹成熟:针对文本和大语言模型(LLM)的基于扩散的攻击、针对图像分类器的基于扩散的攻击、针对视觉-语言模型的越狱流水线,以及基于扩散的输入净化防御。每条轨迹都发展了自己的词汇、威胁模型与基准,去噪扩散模型作为一种共享的生成机制涌现,其方法正在各社区间被积极移植。本综述在元研究层面执行了一项信息融合工作:我们将这四条轨迹整合为一个带有统一分类法、评估标准和研究议程的单一概念框架,聚焦于 LLM 侧部分。我们编录了四个范围内的五十篇已发表论文(文本/LLM、图像分类器、视觉-语言模型、防御),以及四个以扩散-LLM 为受害者的条目和十个新攻击必须与之比较的非扩散基线。我们提出了对抗流水线中扩散角色的六类分类法,并辅以记录攻击者知识、查询预算和目标可访问性的威胁模型轴,以及跨模态统一应用的五维框架(攻击成功率、可迁移性、查询预算、困惑度、防御规避)。该综述采用攻击者与防御者双重视角:在攻击编录之外,我们涵盖了四种基于扩散的防御,它们构成新攻击的自然评估背景。我们的批判性分析指出了当前 LLM 侧文献的五个反复出现的弱点,并以开放问题和具体实验设计的研究议程作结。随论文发布了配套的编录与电子表格。我们明确声明这是一项带质量评估的叙事综述,而非 PRISMA 合规的系统综述,并讨论了其对可复现性的影响。
引用
@article{arxiv.2606.26566,
title = {Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models},
author = {Abrar Alotaibi and Moataz Ahmed},
journal= {arXiv preprint arXiv:2606.26566},
year = {2026}
}