逐层对齐:视觉语言模型中图像编码器各层的安全性对齐研究
计算与语言
2025-06-23 v2 计算机视觉与模式识别
摘要
视觉语言模型(VLM)的能力已显著提升,但其复杂的架构使其安全性对齐具有挑战性。本文揭示了有害信息在图像编码器中间层中的不均匀分布,并表明跳过某些层并提前退出会增加 VLM 生成有害响应的可能性。我们将其称为基于图像编码器提前退出的脆弱性(ICET)。我们在三个 VLM——LLaVA-1.5、LLaVA-NeXT 和 Llama 3.2——上的实验表明,从图像编码器提前退出会显著增加生成有害输出的可能性。为解决这一问题,我们提出了一种简单而有效的对 Clipped-Proximal Policy Optimization(Clip-PPO)算法的修改,用于对 VLM 执行逐层多模态 RLHF。我们将其称为逐层 PPO(L-PPO)。我们在三个多模态数据集上评估了 L-PPO 算法,结果表明它能持续降低提前退出造成的危害性。
引用
@article{arxiv.2411.04291,
title = {Layer-wise Alignment: Examining Safety Alignment Across Image Encoder Layers in Vision Language Models},
author = {Saketh Bachu and Erfan Shayegani and Rohit Lal and Trishna Chakraborty and Arindam Dutta and Chengyu Song and Yue Dong and Nael Abu-Ghazaleh and Amit K. Roy-Chowdhury},
journal= {arXiv preprint arXiv:2411.04291},
year = {2025}
}
备注
Accepted by ICML 2025 as a spotlight poster