中文

FC-Attack:通过自动生成的流程图对多模态大语言模型进行越狱攻击

计算机视觉与模式识别 2025-09-23 v3 人工智能 密码学与安全 机器学习

摘要

多模态大语言模型已经变得非常强大,并在一些实际应用中被广泛采用。然而,最近的研究揭示了它们对多模态越狱攻击的脆弱性,即模型可能被诱导生成有害内容,从而导致安全风险。尽管大多数 MLLM 已经过安全对齐,但最近的研究表明视觉模态仍然容易受到越狱攻击。在我们的工作中,我们发现通过使用包含部分有害信息的流程图,可以诱导 MLLM 提供额外的有害细节。基于此,我们提出了一种基于自动生成流程图的越狱攻击方法 FC-Attack。具体而言,FC-Attack 首先微调预训练的 LLM,基于良性数据集创建一个步骤描述生成器。然后使用该生成器生成与有害查询对应的步骤描述,并将其转换为3种不同形状(垂直、水平和S形)的流程图作为视觉提示。然后将这些流程图与良性文本提示相结合,对 MLLM 执行越狱攻击。我们在 Advbench 上的评估表明,FC-Attack 在多个 MLLM 上通过图像实现的攻击成功率高达96%,通过视频高达78%。此外,我们调查了影响攻击性能的因素,包括流程图中的步骤数量和字体样式。我们还发现,在 Claude-3.5 中,FC-Attack 可以通过改变字体样式将越狱性能从4%提高到28%。为了缓解攻击,我们探索了几种防御措施,发现 AdaShield 可以在很大程度上降低越狱性能,但代价是实用性下降。

关键词

引用

@article{arxiv.2502.21059,
  title  = {FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts},
  author = {Ziyi Zhang and Zhen Sun and Zongmin Zhang and Jihui Guo and Xinlei He},
  journal= {arXiv preprint arXiv:2502.21059},
  year   = {2025}
}

备注

Accepted to Findings of EMNLP 2025