SIA:通过意图感知增强视觉语言模型的安全性
计算机视觉与模式识别
2025-10-07 v2 人工智能
摘要
随着视觉语言模型(VLMs)在现实世界应用中的部署日益增多,此前被忽视的安全风险正变得越来越明显。特别是,看似无害的多模态输入可能相互结合从而暴露有害意图,导致不安全的模型输出。尽管多模态安全性受到越来越多的关注,但现有方法往往无法应对此类潜在风险,尤其是当危害仅源于模态间的交互时。我们提出了 SIA(Safety via Intent Awareness,基于意图感知的安全性),这是一个免训练、具备意图感知的安全框架,能够主动检测多模态输入中的有害意图,并利用该意图来指导安全响应的生成。SIA 遵循三阶段流程:(1)通过图像描述进行视觉抽象;(2)通过少样本思维链(CoT)提示进行意图推断;(3)基于意图的条件响应生成。通过动态适应从图文对中推断出的隐式意图,SIA 无需大规模重训练即可缓解有害输出。在包括 SIUO、MM-SafetyBench 和 HoliSafe 在内的安全基准上的大量实验表明,SIA 持续提升了安全性,并优于先前的免训练方法。
引用
@article{arxiv.2507.16856,
title = {SIA: Enhancing Safety via Intent Awareness for Vision-Language Models},
author = {Youngjin Na and Sangheon Jeong and Youngwan Lee and Jian Lee and Dawoon Jeong and Youngman Kim},
journal= {arXiv preprint arXiv:2507.16856},
year = {2025}
}
备注
Accepted to Safe and Trustworthy Multimodal AI Systems(SafeMM-AI) Workshop at ICCV2025, Non-archival track