Phantasia:面向视觉语言模型的情境自适应后门攻击
计算机视觉与模式识别
2026-04-10 v1 人工智能
摘要
近期视觉语言模型(VLM)的快速发展显著提升了视觉感知与语言推理的集成能力,推动了多模态理解的快速进步。尽管取得了这些成就,VLM的安全性——尤其是其对后门攻击的脆弱性——仍严重受到忽视。现有针对VLM的后门攻击仍处于早期发展阶段,大多数方法依赖生成包含固定、易被识别模式的受污染响应。本文作出两个关键贡献:首先,首次展示了现有VLM后门攻击的隐蔽性被严重高估了。通过采用最初针对其他领域(如视觉模型和文本模型)设计的防御技术,我们表明多个最新攻击方法均可被轻易检测。其次,为弥补这一差距,我们引入Phantasia,一种情境自适应后门攻击,动态地将其受污染输出与每个输入的语义相吻合。不同于产生静态受污染模式,Phantasia鼓励模型生成在上下文上连贯且恶意的响应,保持合理性,从而显著提升隐蔽性和适应性。跨多种VLM架构的广泛实验表明,Phantasia在保持各种防御设置下良好 benign 性能的同时,实现了高达最新水平的攻击成功率。
引用
@article{arxiv.2604.08395,
title = {Phantasia: Context-Adaptive Backdoors in Vision Language Models},
author = {Nam Duong Tran and Phi Le Nguyen},
journal= {arXiv preprint arXiv:2604.08395},
year = {2026}
}
备注
CVPR 2026 Findings