中文

CoCA:通过宪法校准重获多模态大语言模型的安全意识

计算与语言 2024-10-10 v2

摘要

多模态大语言模型(MLLMs)的部署在涉及视觉输入的对话中取得了显著成功,这得益于大语言模型(LLMs)的强大能力。这些 MLLMs 通常基于 LLMs 构建,并配备一个图像编码器,将图像处理到 LLMs 的令牌嵌入空间中。然而,视觉模态的集成引入了一个独特的脆弱性:即使 LLM 已经在文本数据集上进行了训练以与人类价值对齐,MLLM 也变得容易受到恶意视觉输入的影响,并倾向于生成敏感或有害的响应。在本文中,我们首先提出一个问题:“MLLMs 是否具备针对恶意图像输入的安全意识?”我们发现,在 MLLM 的输入中添加一条指定安全要求的原则后,模型的安全意识得到了增强。这一现象验证了 MLLM 针对图像输入的安全意识的存在,它只是被模态差距削弱了。然后,我们引入了一种简单而有效的技术,称为 CoCA,它通过校准 MLLM 的输出分布来放大其安全意识。我们提出的策略有助于模型恢复其原始的安全意识,而不会丧失其原始能力。我们在多模态安全性和理解基准上验证了我们方法的有效性。

关键词

引用

@article{arxiv.2409.11365,
  title  = {CoCA: Regaining Safety-awareness of Multimodal Large Language Models with Constitutional Calibration},
  author = {Jiahui Gao and Renjie Pi and Tianyang Han and Han Wu and Lanqing Hong and Lingpeng Kong and Xin Jiang and Zhenguo Li},
  journal= {arXiv preprint arXiv:2409.11365},
  year   = {2024}
}

备注

10 pages, COLM-2024