中文

Precise Shield:基于神经元级引导的 VLLM 安全解释与对齐

计算机视觉与模式识别 2026-04-13 v1

摘要

在实际部署中,视觉语言大模型(VLLM)面临来自多语言和多模态复合攻击的严重挑战:含低资源语言文本的有害图像容易绕过针对高资源语言场景设计的防御,暴露了当前跨语言和跨模态安全方法的结构盲区。这引发了一个机制性问题:安全能力在模型中具体实例化于何处,以及在不同语言和模态间如何分布?先前针对纯文本 LLM 的研究识别出跨语言共享安全神经元,表明安全可能由少数关键神经元支配。基于此洞察,我们提出Precise Shield框架,分为两个阶段:首先通过对比有害与良性输入的激活模式来识别安全神经元,然后通过梯度遮蔽将参数更新严格限制在该子空间内,影响 fewer than 0.03%的参数。该策略显著提升安全性,同时保持多语言和多模态泛化。进一步分析显示,不同语言和模态间的安全神经元存在适度重叠,使其实现零样本跨语言和跨模态安全能力迁移,为神经元级、基于迁移的安全增强提供了新方向。

关键词

引用

@article{arxiv.2604.08881,
  title  = {Precise Shield: Explaining and Aligning VLLM Safety via Neuron-Level Guidance},
  author = {Enyi Shi and Fei Shen and Shuyi Miao and Linxia Zhu and Pengyang Shao and Jinhui Tang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2604.08881},
  year   = {2026}
}