SafeSteer:一种面向多模态大语言模型的解码级防御机制
人工智能
2026-05-13 v1
摘要
多模态大语言模型(MLLMs)正受到越来越多的关注。由于其输入特征的异质性,它们在越狱防御方面面临重大挑战。当前的防御方法依赖于昂贵的微调或低效的事后干预,限制了它们应对新型攻击的能力,并涉及性能权衡。为解决上述问题,我们探索了MLLMs内在的安全能力,并量化了它们在解码阶段识别有害性的固有能力。我们观察到:1)MLLMs在解码过程中能够区分有害和无害的输入;2)基于图像的攻击更具隐蔽性。基于这些见解,我们引入了SafeSteer,一种面向MLLMs的解码级防御机制。具体来说,它包含一个解码探针(Decoding-Probe),这是一个轻量级探针,用于在解码过程中检测和纠正有害输出,从而迭代地将解码过程引导向安全方向。此外,还集成了一个模态语义对齐向量,将强大的文本安全对齐能力迁移到视觉模态。在多个MLLMs上的实验表明,SafeSteer可以在不进行微调的情况下将MLLMs的安全性提高高达33.40%。值得注意的是,它能够保持MLLMs的有效性,确保其有用性和无害性之间的平衡。
引用
@article{arxiv.2605.11716,
title = {SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models},
author = {Xinyi Zeng and Xue Yang and Jingyuan Zhang and Huanqian Yan and Xiang Chen and Kaiwen Wei and Hankun Kang and Yu Tian},
journal= {arXiv preprint arXiv:2605.11716},
year = {2026}
}