中文

VLLM 安全悖论:越狱攻击与防御的双重易行性

密码学与安全 2025-03-07 v2 计算机视觉与模式识别

摘要

视觉大语言模型(VLLM)易受越狱攻击并不令人意外。然而,针对这些攻击的近期防御机制在基准评测中往往以极小代价达到了近饱和性能。攻击与防御双方均表现出的这种“双高性能”引发了一个根本且令人困惑的悖论。为深入理解该问题并进一步增强 VLLM 的可信度,本文做出三项关键贡献:i) 对 VLLM 易受越狱攻击的一种尝试性解释——\textbf{视觉输入的引入},及其深入分析。ii) 识别出现有防御机制中一个被广泛忽视的问题——\textbf{过度谨慎}。该问题导致这些防御方法在良性输入下也出现非预期的拒答,从而削弱了其忠实防御攻击的可靠性。iii) 一种简单的安全感知方法——\textbf{LLM-Pipeline}。该方法复用现成 LLM 的更先进护栏,作为 VLLM 响应前的有效替代检测器。最后但同样重要的是,我们发现两种代表性的越狱评测方法常表现出随机一致性。这一局限使得在评估攻击策略或防御机制时可能产生误导。我们相信本文的发现为重新思考 VLLM 安全的基础发展(涉及基准数据集、防御策略和评测方法)提供了有益洞见。

关键词

引用

@article{arxiv.2411.08410,
  title  = {The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense},
  author = {Yangyang Guo and Fangkai Jiao and Liqiang Nie and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2411.08410},
  year   = {2025}
}

备注

Logic smoothing and language polishing