基于隐式触发器的视觉语言模型后门攻击:巧妙语义操控
计算机视觉与模式识别
2025-06-10 v1 密码学与安全
摘要
视觉语言模型(VLMs)展现出卓越的性能,但也面临后门攻击的脆弱性,攻击者可通过隐藏触发器操控模型输出。先前的攻击主要依赖单一模态触发器,未充分探索VLMs中跨模态融合的关键特性。不同于先前工作,本文识别了一种新颖的攻击面,即利用跨模态语义不匹配作为隐式触发器。基于这一洞察,我们提出BadSem(Backdoor Attack with Semantic Manipulation),一种数据投毒攻击,通过刻意扰乱图像-文本配对来植入隐形后门。为实现此攻击,我们构建了SIMBad数据集,用于语义操控,涉及颜色和物体属性。广泛实验表明,BadSem在四个广泛使用的VLMs上实现了98%以上的平均攻击成功率,能良好推广至离群分布数据集,并可跨投毒模态传递。我们通过注意力可视化进行的详细分析显示,后门化模型在不匹配条件下聚焦于语义敏感区域,而在干净输入上保持正常行为。为缓解此攻击,我们尝试两种防御策略基于系统提示和监督微调,但发现两者均未能有效缓解语义后门。我们的发现凸显了迫切需要解决VLMs中语义漏洞的紧迫性,以确保其在实际部署中的安全性。
引用
@article{arxiv.2506.07214,
title = {Backdoor Attack on Vision Language Models with Stealthy Semantic Manipulation},
author = {Zhiyuan Zhong and Zhen Sun and Yepang Liu and Xinlei He and Guanhong Tao},
journal= {arXiv preprint arXiv:2506.07214},
year = {2025}
}