眼睛闭上,安全打开:通过图像到文本转换保护多模态大语言模型
计算机视觉与模式识别
2024-10-16 v4
摘要
多模态大语言模型(MLLMs)显示出令人印象深刻的推理能力。然而,它们比其 LLM 前身更容易受到越狱攻击。尽管仍能检测不安全的响应,但我们注意到,随着图像特征的引入,MLLMs 中预对齐 LLMs 的安全机制很容易被绕过。为构建稳健的 MLLMs,本文提出了 ECSO(Eyes Closed, Safety On),一种新颖的无训练保护方法,利用 MLLMs 固有的安全意识,通过适应性地将不安全的图像转换为文本,以激活 MLLMs 中预对齐 LLMs 的内在安全机制。针对五个最先进(SoTA)MLLMs 进行实验,表明 ECSO 在显著提升模型安全性方面效果显著(例如,在 MM-SafetyBench(SD+OCR)上提升 37.6%,在 VLSafe 上提升 71.3%),同时在常规 MLLM 基准测试中保持实用性结果。此外,我们展示了 ECSO 可用作数据引擎,用于为 MLLM 对齐生成监督微调(SFT)数据,而无需额外的人工介入。
引用
@article{arxiv.2403.09572,
title = {Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation},
author = {Yunhao Gou and Kai Chen and Zhili Liu and Lanqing Hong and Hang Xu and Zhenguo Li and Dit-Yan Yeung and James T. Kwok and Yu Zhang},
journal= {arXiv preprint arXiv:2403.09572},
year = {2024}
}
备注
ECCV2024 (Project Page: https://gyhdog99.github.io/projects/ecso/)