中文

AMIA:自动掩码与联合意图分析使 LVLMs 成为鲁棒的越狱防御者

计算机视觉与模式识别 2025-06-02 v1 计算与语言

摘要

我们引入了 AMIA,一种用于大型视觉语言模型(LVLMs)的轻量级、仅推理防御方法,其(1)自动掩码一小部分与文本无关的图像块以破坏对抗性扰动,并(2)进行联合意图分析,以在生成响应之前揭示并缓解隐藏的有害意图。无需任何重训练,AMIA 将多种 LVLMs 和越狱基准上的防御成功率从平均 52.4% 提升至 81.7%,仅以平均 2% 的准确率下降保留了通用效用,且仅产生适度的推理开销。消融实验证实,掩码和意图分析对于实现鲁棒的安全-效用权衡都是必不可少的。

关键词

引用

@article{arxiv.2505.24519,
  title  = {AMIA: Automatic Masking and Joint Intention Analysis Makes LVLMs Robust Jailbreak Defenders},
  author = {Yuqi Zhang and Yuchun Miao and Zuchao Li and Liang Ding},
  journal= {arXiv preprint arXiv:2505.24519},
  year   = {2025}
}

备注

11 pages, 7 figures