HiddenDetect:通过监控隐藏状态检测大型视觉语言模型的越狱攻击
计算与语言
2025-06-24 v4
摘要
将额外模态集成到大型视觉语言模型(LVLMs)中,使其相对于纯语言模型更容易暴露于安全风险,如越狱攻击。虽然现有研究主要聚焦于事后对齐技术,但LVLMs内部的底层安全机制仍 largely 未被探索。本文我们研究LVLMs在推理期间是否在其内部激活中编码了与安全相关的信号。我们的发现表明,LVLMs在处理不安全提示时表现出不同的激活模式,可用于检测和缓解对抗性输入,而无需大量微调。基于这一洞见,我们引入HiddenDetect,一个 novel tuning-free 框架,利用内部模型激活来增强安全性。实验结果表明,HiddenDetect 在检测LVLMs的越狱攻击方面优于现有SOTA方法。通过利用内在的安全感知模式,我们的方法提供了一种高效且可扩展的解决方案,用于加强LVLMs针对多模态威胁的鲁棒性。我们的代码将在https://github.com/leigest519/HiddenDetect公开发布。
引用
@article{arxiv.2502.14744,
title = {HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States},
author = {Yilei Jiang and Xinyan Gao and Tianshuo Peng and Yingshui Tan and Xiaoyong Zhu and Bo Zheng and Xiangyu Yue},
journal= {arXiv preprint arXiv:2502.14744},
year = {2025}
}
备注
Accepted by ACL 2025 (Main)