解构与缓解视觉语言模型的安全对齐退化
计算与语言
2024-10-14 v1 人工智能
机器学习
摘要
视觉语言模型(VLM)的安全对齐能力容易因引入视觉模块而削弱,其背后是其LLM主干模型的能力。我们调查了这一现象,称为“安全对齐退化”,并指出,这一挑战源于在VLM中引入视觉模态后所产生的表示间隙。具体而言,我们表明,多模态输入的表示会偏离文本单模态输入的表示,而后者代表了LLM主干模型所优化的分布。与此同时,最初在文本嵌入空间中开发的安全对齐能力,并未成功地迁移到这种新的多模态表示空间。为减少安全对齐退化,我们引入跨模态表示操纵(CMRM),这是一种推理时间的表示干预方法,用于恢复VLMs中源自LLM主干的安全对齐能力,同时保持VLMs的功能能力。实验结果表明,我们的框架在不额外训练的情况下,显著恢复了从LLM主干继承的对齐能力,对VLMs的流畅性和语言能力几乎没有影响。具体而言,LLaVA-7B在多模态输入上的不安全率可从61.53%降低至仅3.15%。WARNING:本文包含有毒或有害语言的示例。
引用
@article{arxiv.2410.09047,
title = {Unraveling and Mitigating Safety Alignment Degradation of Vision-Language Models},
author = {Qin Liu and Chao Shang and Ling Liu and Nikolaos Pappas and Jie Ma and Neha Anna John and Srikanth Doss and Lluis Marquez and Miguel Ballesteros and Yassine Benajiba},
journal= {arXiv preprint arXiv:2410.09047},
year = {2024}
}
备注
Preprint