大型视觉语言模型中的跨模态安全机制迁移
计算机视觉与模式识别
2025-03-03 v2 人工智能
计算与语言
摘要
大型视觉语言模型(LVLMs)中的视觉语言对齐成功地使LLM能够理解视觉输入。然而,我们发现现有的视觉语言对齐方法无法将LLMs中现有的文本安全机制有效迁移到视觉领域,这导致了对有毒图像的脆弱性。为了探索这一问题的原因,我们对LVLMs的安全机制在何处以及如何运作进行了深刻的解释,并对文本和视觉进行了比较分析。我们发现,位于特定转换器层的隐藏状态在安全机制成功激活中起关键作用,而当前方法在隐藏状态层面的视觉语言对齐不足。这导致输入图像相对于文本在隐藏状态中的语义偏移,从而误导了安全机制。为此,我们提出了一种新颖的文本引导视觉语言对齐方法(TGA),用于LVLMs。TGA检索与输入视觉相关的文本,并使用它们来指导视觉进入LLMs中隐藏状态空间的投影。实验表明,TGA不仅成功地将基本LLMs中针对文本的安全机制迁移到视觉语言对齐中用于LVLMs的视觉,而且在各种视觉任务上(安全和性能良好)保持了一般性能。
引用
@article{arxiv.2410.12662,
title = {Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models},
author = {Shicheng Xu and Liang Pang and Yunchang Zhu and Huawei Shen and Xueqi Cheng},
journal= {arXiv preprint arXiv:2410.12662},
year = {2025}
}
备注
ICLR 2025