中文

通过减小预训练模态鸿沟提升 LLM 鲁棒性以保障 VLM 安全

人工智能 2025-06-02 v1

摘要

确保视觉语言模型 生成安全的输出对于其可靠部署至关重要。然而,与其 LLM 骨干相比,LVLM 存在急剧的安全性退化。即使是空白或无关的图像也能触发 LVLM 对在纯文本语境中本会被拒绝的提示生成有害响应。近期有假设提出,图像与文本表示之间的模态鸿沟导致了 LVLM 的安全性退化。然而,模态鸿沟的大小是否以及如何影响 LVLM 的安全性尚未得到研究。在本工作中,我们表明模态鸿沟的大小与 VLM 的安全性呈高度负相关。随后,我们表明该模态鸿沟是在预训练 LVLM 期间引入的,并持续存在于微调过程。受此观察启发,我们提出一种在预训练期间减小模态鸿沟的正则化方法。我们在 LLaVA v1.5、ShareGPT4V 和 MiniGPT-4 上的大量实验表明,我们的方法在不损害性能的情况下,显著提升了 LVLM 的安全对齐,将不安全率最高降低 16.3%,并可进一步将现有防御提升高达 18.2%。

关键词

引用

@article{arxiv.2505.24208,
  title  = {Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap},
  author = {Wenhan Yang and Spencer Stice and Ali Payani and Baharan Mirzasoleiman},
  journal= {arXiv preprint arXiv:2505.24208},
  year   = {2025}
}