中文

针对提示驱动视频分割基础模型的后门攻击

计算机视觉与模式识别 2026-05-01 v2 密码学与安全

摘要

以 SAM2 为代表的提示驱动视频分割基础模型(VSFM)正越来越多地应用于自动驾驶和数字病理学等领域,但其安全风险仍未得到充分探索。我们研究了针对 VSFM 的后门攻击,并表明直接应用 BadNet 等经典攻击在很大程度上是无效的,攻击成功率(ASR)低于 5%。通过梯度相似性和注意力图分析,我们发现传统后门训练失败的原因在于干净样本和触发样本诱导的图像编码器梯度是对齐的,而模型注意力仍然集中在提示指定的对象上,而非触发器上。为解决这一局限,我们提出了 BadVSFM,这是首个为提示驱动 VSFM 量身定制的后门攻击框架。BadVSFM 采用两阶段策略:首先学习触发器特定的编码器特征,然后训练解码器将触发帧的提示表示映射到攻击者指定的目标掩码,同时保持干净的干净分割行为。在五个 VSFM 和两个数据集上的实验表明,BadVSFM 在不同触发器和提示类型上均实现了强大且可控的后门效果,且干净性能下降有限。消融和可解释性分析验证了两阶段设计的必要性,而五种代表性防御措施在很大程度上仍然无效。我们的结果揭示了当前 VSFM 面临的一个实际且未被充分探索的后门威胁漏洞。

关键词

引用

@article{arxiv.2512.22046,
  title  = {Backdoor Attacks on Prompt-Driven Video Segmentation Foundation Models},
  author = {Zongmin Zhang and Zhen Sun and Yifan Liao and Wenhan Dong and Xinlei He and Xingshuo Han and Shengmin Xu and Xinyi Huang},
  journal= {arXiv preprint arXiv:2512.22046},
  year   = {2026}
}