中文

以牙还牙:通过对抗防御保护大型视觉语言模型免受越狱攻击

密码学与安全 2025-03-17 v1

摘要

部署大型视觉语言模型(LVLMs)引入了一种独特的脆弱性:易受通过视觉输入的恶意攻击。然而,现有的防御方法存在两个关键局限:(1)它们仅关注文本防御,未能直接解决攻击起源的视觉领域中的威胁;(2)额外的处理步骤通常会带来显著的计算开销,或损害模型在良性任务上的性能。基于这些见解,我们提出了 ESIII(Embedding Security Instructions Into Images),一种将视觉空间从脆弱性来源转化为主动防御机制的新方法。首先,我们通过基于梯度的优化将安全指令嵌入防御图像中,获得视觉维度上的安全指令。随后,我们将视觉和文本维度上的安全指令与输入查询相整合。不同维度安全指令之间的协作确保了全面的安全防护。大量实验表明,我们的方法有效增强了 LVLMs 抵御此类攻击的鲁棒性,同时保持了其在标准良性任务上的性能,且仅带来难以察觉的时间成本增加。

关键词

引用

@article{arxiv.2503.11619,
  title  = {Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense},
  author = {Shuyang Hao and Yiwei Wang and Bryan Hooi and Ming-Hsuan Yang and Jun Liu and Chengcheng Tang and Zi Huang and Yujun Cai},
  journal= {arXiv preprint arXiv:2503.11619},
  year   = {2025}
}