中文

JPRO:基于多智能体协作框架的自动多模态越狱

密码学与安全 2025-11-11 v1

摘要

大型视觉语言模型的广泛应用使得确保其安全部署至关重要。虽然最近的研究表明对 VLMs 实施越狱攻击,但现有方法存在局限:要么需要白盒访问,限制实用性,要么依赖手动制作的模式,导致样本多样性和可扩展性差。为解决这些差距,我们提出了 JPRO,一个用于自动 VLM 越狱的新型多智能体协作框架。它有效克服了先前方法在攻击多样性和可扩展性方面的不足。通过四个专门智能体的协调行动及其两个核心模块:Tactic-Driven Seed Generation 和 Adaptive Optimization Loop,JPRO 生成有效且多样的攻击样本。实验结果表明,JPRO 在多个高级 VLMs 上实现了超过 60% 的攻击成功率,显著优于现有方法。作为一种黑盒攻击方法,JPRO 不仅揭示了多模态模型中的关键安全漏洞,也为评估和提高 VLM 鲁棒性提供了有价值的见解。

关键词

引用

@article{arxiv.2511.07315,
  title  = {JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework},
  author = {Yuxuan Zhou and Yang Bai and Kuofeng Gao and Tao Dai and Shu-Tao Xia},
  journal= {arXiv preprint arXiv:2511.07315},
  year   = {2025}
}