中文

内部激活修订:无需参数更新即可保护视觉语言模型

机器学习 2025-01-29 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

视觉语言模型(VLMs)表现出强大的多模态能力,但被发现比其背后的大语言模型(LLMs)更容易生成有害内容。我们的调查发现,图像的集成在前向传递期间显著偏离文本输入触发的内部激活。此外,嵌入在 VLMs 中的 LLM 的安全对齐不够稳健,以处理激活差异,使模型容易受到最简单的攻击。为了解决这个问题,我们提出了一种 internal activation revision 方法,该方法在生成期间高效修订激活,将模型引导 toward 更安全的输出。我们的框架在层级和 head 级别都包含修订,提供了对模型生成在不同细粒度水平上的控制。此外,我们探索了三种构建正负样本的策略和两种提取修订向量的方法,导致不同变体的方法。进行了全面的实验,表明 internal activation revision 方法显著提高了广泛使用的 VLMs 的安全性,在 SafeBench、Safe-Unsafe、Unsafe 和 MM-SafetyBench 上的攻击成功率分别降低了 48.94%、34.34%、43.92% 和 52.98%,同时对模型的有用性几乎没有影响。

关键词

引用

@article{arxiv.2501.16378,
  title  = {Internal Activation Revision: Safeguarding Vision Language Models Without Parameter Update},
  author = {Qing Li and Jiahui Geng and Zongxiong Chen and Kun Song and Lei Ma and Fakhri Karray},
  journal= {arXiv preprint arXiv:2501.16378},
  year   = {2025}
}