中文

PBI-攻击:面向毒性最大化的先验引导的双模交互式黑箱越狱攻击

密码学与安全 2025-09-03 v4 人工智能

摘要

理解大型视觉语言模型(LVLMs)针对越狱攻击的漏洞对于其负责任的实际部署至关重要。大多数先前的工作需要访问模型梯度,或基于人类知识(提示工程)来完成越狱,他们很少考虑图像和文本的交互,导致在黑箱场景下无法进行越狱或性能较差。为克服这些限制,我们提出了一种面向毒性最大化的先验引导的双模交互式黑箱越狱攻击,称为PBI-Attack。我们的方法从替代LVM从有害语料库中提取恶意特征,并将这些特征嵌入到良性图像中作为先验信息。随后,我们通过双向跨模态交互优化来增强这些特征,这些特征通过贪婪搜索交替方式优化双模态扰动,以最大化生成响应的毒性。毒性水平由经过训练的评估模型量化。实验表明,PBI-Attack在三个开源LVLMs上超过以前的国家级越狱方法,实现了平均92.5%的攻击成功率,在三个闭源LVLMs上约为67.3%。免责声明:本文包含可能令人不适和冒犯的内容。

关键词

引用

@article{arxiv.2412.05892,
  title  = {PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization},
  author = {Ruoxi Cheng and Yizhong Ding and Shuirong Cao and Ranjie Duan and Xiaoshuang Jia and Shaowei Yuan and Simeng Qin and Zhiqiang Wang and Xiaojun Jia},
  journal= {arXiv preprint arXiv:2412.05892},
  year   = {2025}
}

备注

Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization