中文

多模态大语言模型的启发式诱导风险分布越狱攻击

密码学与安全 2025-08-19 v3 人工智能

摘要

随着多模态大语言模型(MLLMs)的快速发展,关于其安全性的关注日益捕捉到学术界和产业界的注意。尽管MLLMs易受越狱攻击,但在现实部署场景中设计有效的越狱攻击仍面临独特挑战,尤其是受限于实际攻击能力。以往工作将风险集中于单一模态,导致越狱性能有限。本文提出一种称为HIMRD的启发式诱导多模态风险分布越狱攻击方法,该方法为黑盒且包含两个要素:多模态风险分布策略和启发式诱导搜索策略。多模态风险分布策略用于将有害语义分布到多个模态,以有效规避MLLMs的单模态保护机制。启发式诱导搜索策略识别两种提示:理解增强提示有助于MLLMs重建恶意提示,诱导提示增加肯定输出相对于拒绝输出的可能性,从而实现成功的越狱攻击。HIMRD在七个开源MLLMs上实现约90%的平均攻击成功率(ASR),在三个闭源MLLMs中实现约68%的平均ASR。HIMRD揭示了当前MLLMs中的跨模态安全漏洞,凸显了开发防御策略以缓解此类新兴风险的紧迫性。代码已公开于https://github.com/MaTengSYSU/HIMRD-jailbreak。

关键词

引用

@article{arxiv.2412.05934,
  title  = {Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models},
  author = {Ma Teng and Jia Xiaojun and Duan Ranjie and Li Xinfeng and Huang Yihao and Jia Xiaoshuang and Chu Zhixuan and Ren Wenqi},
  journal= {arXiv preprint arXiv:2412.05934},
  year   = {2025}
}

备注

ICCV 2025