中文

TokenSwap:大型视觉语言模型组合理解的后门攻击

计算机视觉与模式识别 2025-09-30 v1

摘要

大型视觉语言模型(LVMM)在广泛的视觉语言任务中取得了令人瞩目的性能,但它们仍然容易受到后门攻击。现有针对 LVMM 的后门攻击旨在迫使受害模型生成预定义的目标模式,这些模式要么被插入要么取代原始内容。我们发现,这些固定模式攻击相对容易检测,因为受攻击的 LVMM 会记忆训练数据集中这些频繁模式,从而在给定受毒化输入时对这些目标表现过度自信。为克服这些限制,我们提出了 TokenSwap,这是一种更具隐蔽性和 stealthiness 的后门攻击,旨在干扰 LVMM 的组合理解能力。具体而言,TokenSwap 会导致受后门控制的模型生成提到图像中正确对象的输出,但误表述这些对象的关系(即基于词袋的行为)。在训练期间,TokenSwap 会注入选定样本中的视觉触发器,同时交换相应文本答案中关键 token 的语法角色。然而,受毒化样本仅与原始样本存在细微差异,这使得模型难以学习后门行为。为此,TokenSwap 采用自适应 token 加权损失,显式强调交换 token 的学习,以便将视觉触发器和基于词袋的行为关联起来。广泛的实验表明,TokenSwap 在保持卓越的隐蔽性和 stealthiness 的同时,实现了高攻击成功率,适用于多个基准和各种 LVMM 架构。

关键词

引用

@article{arxiv.2509.24566,
  title  = {TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language Models},
  author = {Zhifang Zhang and Qiqi Tao and Jiaqi Lv and Na Zhao and Lei Feng and Joey Tianyi Zhou},
  journal= {arXiv preprint arXiv:2509.24566},
  year   = {2025}
}