理解和纠正视觉语言模型中安全感知失真
计算机视觉与模式识别
2025-02-19 v1 计算与语言
机器学习
摘要
近期研究表明,随着视觉模态的集成,视觉语言模型(VLM)对有害请求和越狱攻击的脆弱性增加,优于其文本-only LLM backbone。为探究这一现象的根本原因,我们进行深入分析,识别出关键问题:多模态输入引入的模态诱导激活偏移,倾向于“更安全”的方向,导致 VLMs 系统性地高估有害输入的安全性。我们将此问题称为安全感知失真。为缓解此类失真,我们提出一种基于激活偏移解缔与校准(ShiftDC)的训练-free 方法,通过分解和校准模态诱导的激活偏移来减少模态对安全性的影响。通过隔离和移除与安全相关的成分,ShiftDC 恢复了 LLM backbone 本身的安全对齐,同时保留了 VLMs 的视觉语言能力。实证结果表明,ShiftDC 在不损害模型实用性的前提下,显著提升了在安全基准测试中的对齐性能。
引用
@article{arxiv.2502.13095,
title = {Understanding and Rectifying Safety Perception Distortion in VLMs},
author = {Xiaohan Zou and Jian Kang and George Kesidis and Lu Lin},
journal= {arXiv preprint arXiv:2502.13095},
year = {2025}
}