中文

对齐多模态大语言模型的通用对抗攻击

人工智能 2025-06-06 v3

摘要

我们提出了一种针对多模态大语言模型(LLMs)的通用对抗攻击,利用单张优化图像来覆盖不同查询甚至多个模型的对齐保护机制。通过反向传播穿过视觉编码器和语言头,我们设计了一张合成图像,迫使模型以目标短语(例如"Sure, here it is")或其他不安全内容进行回应——即使面对有害提示也是如此。在 SafeBench 和 MM-SafetyBench 基准测试上的实验中,我们的方法相较于现有基线(包括纯文本通用提示,在某些模型上高达81%)实现了更高的攻击成功率。我们进一步通过同时训练多个多模态 LLMs 展示了跨模型的通用性。此外,我们方法的多种答案变体产生了更自然(但仍具恶意)的回应。这些发现凸显了当前多模态对齐中的关键漏洞,并呼吁更鲁棒的对抗防御。我们将以 Apache-2.0 许可证发布代码和数据集。警告:本文中多模态 LLMs 生成的部分内容可能具有冒犯性。

关键词

引用

@article{arxiv.2502.07987,
  title  = {Universal Adversarial Attack on Aligned Multimodal LLMs},
  author = {Temurbek Rahmatullaev and Polina Druzhinina and Nikita Kurdiukov and Matvey Mikhalchuk and Andrey Kuznetsov and Anton Razzhigaev},
  journal= {arXiv preprint arXiv:2502.07987},
  year   = {2025}
}

备注

Added benchmarks, baselines, author, appendix