SAVeS:通过语义线索引导视觉语言模型的安全判断
计算机视觉与模式识别
2026-03-20 v1 人工智能
计算与语言
机器学习
摘要
视觉语言模型(VLMs)正在被部署到实际场景和具身化环境中,其中安全决策依赖于视觉上下文。然而,仍不清楚哪些视觉证据驱动了这些判断。我们研究了多模态安全行为是否可以通过简单语义线索来引导。我们引入了一个语义引导框架,通过不改变底层场景内容的条件性文本、视觉和认知干预来实现引导。为评估这些效果,我们提出了SAVeS基准测试,用于语义线索下的情境安全,以及一种将行为拒绝、 grounding 安全推理和误拒绝分开的评估协议。跨多个VLMs的实验以及额外的SOTA基准测试显示,安全决策对语义线索高度敏感,这表明模型依赖于已学习的视觉-语言关联,而非基于 grounding 的视觉理解。我们进一步演示了自动化引导管道可以利用这些机制,这凸显了多模态安全系统潜在的漏洞。
引用
@article{arxiv.2603.19092,
title = {SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues},
author = {Carlos Hinojosa and Clemens Grange and Bernard Ghanem},
journal= {arXiv preprint arXiv:2603.19092},
year = {2026}
}