中文

视觉指令调优使大语言模型更易受越狱攻击

计算机视觉与模式识别 2024-05-08 v1 计算与语言

摘要

通过为大型语言模型(LLM)增添图像理解能力,导致了高性能视觉语言模型(VLM)的崛起。尽管对 LLM 对齐人类价值观的研究广为关注,但 VLM 的安全性未得到相同程度的关注。在本文中,我们探讨了对三种最先进 VLM 的越狱攻击影响,每种 VLM 采用不同的建模方法。通过将每个 VLM 与其相应的 LLM 基础模型进行比较,我们发现每种 VLM 对越狱攻击的敏感性更高。我们将此视为来自视觉指令调优的一种不良结果,即对 LLM 安全防线的遗忘效应。因此,本文基于旨在凸显 VLM 弱点的评估策略,以及在视觉指令调优期间考虑安全措施的建议,为未来工作提供指导。

关键词

引用

@article{arxiv.2405.04403,
  title  = {Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks},
  author = {Georgios Pantazopoulos and Amit Parekh and Malvina Nikandrou and Alessandro Suglia},
  journal= {arXiv preprint arXiv:2405.04403},
  year   = {2024}
}