多模态大语言模型中的安全几何塌陷与自适应漂移校正
人工智能
2026-05-19 v1 密码学与安全
摘要
多模态大语言模型 (MLLMs) 往往无法将在文本模态中学习到的安全能力迁移到语义等价的非文本输入上,揭示了一种持续存在的多模态安全鸿沟。我们从表示几何的视角研究这一鸿沟,分析了文本对齐的拒绝方向和模态诱导的漂移方向。我们表明,多模态输入压缩了拒绝方向上可用的分离度,使其不再能可靠地识别并拒绝有害输入。我们将这种失效模式称为安全几何塌陷。我们通过条件拒绝可分性对其进行了量化,并表明更强的模态诱导漂移始终与更弱的拒绝可分性和更高的攻击成功率相关联。随后,我们通过固定强度的激活干预验证了模态诱导漂移的因果作用:抵消估计的漂移能够恢复拒绝可分性并提升多模态安全性。在漂移校正之后,我们进一步观察到了自我纠正现象,即模型在前向动力学过程中恢复了识别并拒绝有害多模态输入的能力。这种效应也提供了关于模型对每个输入感知有害性的内部信号。受此信号启发,我们提出了 ReGap,一种无需训练的推理时方法,利用自我纠正来自适应地校正模态漂移。在多个多模态安全基准和效用基准上的实验证明了 ReGap 的有效性,它在不损害通用能力的前提下显著提升了 MLLMs 的安全性。我们的发现凸显了表示级别的模态对齐作为实时安全性提升及构建更安全、更可靠的 MLLMs 的关键方向。
引用
@article{arxiv.2605.18104,
title = {Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction},
author = {Jiahe Guo and Xiangran Guo and Jiaxuan Chen and Weixiang Zhao and Yanyan Zhao and Yutai Hou and Qianchao Wang and Dandan Tu and Bing Qin},
journal= {arXiv preprint arXiv:2605.18104},
year = {2026}
}