中文

跨模态识别不安全概念的视觉语言模型差距桥接

密码学与安全 2025-07-16 v1 人工智能

摘要

视觉语言模型(VLMs)日益用于识别不安全或不适当的图像,因其内置伦理标准和强大推理能力。然而,尚不清楚它们是否能够在不同模态(如文本和图像)中识别各种不安全概念。为此,我们首先编译了 UnsafeConcepts 数据集,包含 75 种不安全概念(如“南瓜”、“性骚扰”和“袭击”),以及相关的 1.5K 张图像。随后,我们对 VLMs 的感知(概念识别)和对齐(伦理推理)能力进行系统评估。我们评估了八个流行的 VLMs,发现尽管大多数 VLMs 能准确感知不安全概念,但有时会将这些概念误分类为安全。我们还在开源 VLMs 中识别到了视觉与文本不安全概念之间的一致性模态差距。为弥合这一差距,我们引入一种简化的强化学习(RL)方法,采用定近似政策优化(PPO)来增强从图像中识别不安全概念的能力。我们的做法直接基于 VLM 响应结果给予奖励分数,无需收集人工标注的偏好数据来训练新的奖励模型。实验结果表明,我们的方法在保持一般能力的同时,有效提升了 VLM 在图像上的对齐性能,优于监督微调(SFT)和直接偏好优化(DPO)等基线方法。我们希望我们的 数据集、评估发现以及提出的对齐解决方案能为社区推进安全 VLMs 的努力作出贡献。

关键词

引用

@article{arxiv.2507.11155,
  title  = {Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities},
  author = {Yiting Qu and Michael Backes and Yang Zhang},
  journal= {arXiv preprint arXiv:2507.11155},
  year   = {2025}
}

备注

To Appear in the 34th USENIX Security Symposium, August 2025