SafePTR:基于修剪-恢复机制的多模态大语言模型令牌级越狱防御
密码学与安全
2025-12-04 v2 计算机视觉与模式识别
摘要
通过引入视觉输入,多模态大语言模型(MLLMs)将 LLMs 扩展到支持视觉推理。然而,这种集成也引入了新的漏洞,使 MLLMs 易受多模态越狱攻击,并阻碍其安全部署。现有防御方法,包括图像到文本翻译、安全提示和多模态安全调优,试图通过将多模态输入与 LLMs 内置的安全措施对齐来解决此问题。然而,这些方法未能揭示多模态漏洞的根本原因,特别是有害的多模态标记是如何在 MLLMs 中触发越狱的?因此,它们仍然容易受到文本驱动的多模态越狱攻击,常常表现出过度防御行为,并带来巨大的训练开销。为填补这一差距,我们对 MLLMs 中有害多模态标记如何绕过安全措施进行了全面的分析。意外地我们发现,少于 1% 的标记在早期-中层负责诱导不安全行为,这凸显了通过精确删除少数有害标记、无需进行安全调优,仍能有效提高对越狱攻击的安全性。基于此,我们提出 Safe 修剪-恢复(SafePTR),一个无需训练的防御框架,在脆弱层上选择性地修剪有害标记,同时在后续层上恢复良性特征。无需增加额外的计算开销,SafePTR 显著提高了 MLLMs 的安全性,同时保持了效率。广泛的评估表明,SafePTR 在缓解越狱风险方面表现出业界领先的性能,而不会损害实用性。
引用
@article{arxiv.2507.01513,
title = {SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism},
author = {Beitao Chen and Xinyu Lyu and Lianli Gao and Jingkuan Song and Heng Tao Shen},
journal= {arXiv preprint arXiv:2507.01513},
year = {2025}
}
备注
Accepted by NeurIPS 2025