中文

VLMs能够聚合分散的训练片段

计算机视觉与模式识别 2025-06-06 v1 人工智能 计算与语言 密码学与安全

摘要

缓解视觉-语言模型(VLMs)风险的一种方法是移除其训练数据中的危险样本。然而,当有害图像被分割为小型的、看似无害的片段并散布在许多训练样本中时,这种数据审核很容易被绕过。VLMs随后可能在训练过程中学习将这些片段拼接在一起,并在推理时从完整图像或文本引用中生成有害响应。例如,如果在带有描述"safe"的血腥场景图像片段上训练,VLMs可能后来将完整图像或对该场景的文本引用描述为"safe"。我们将VLMs实现这种攻击的核心能力定义为视觉拼接(visual stitching)——整合散布在多个共享相同文本描述的训练样本中的视觉信息的能力。在我们的工作中,我们首先在三个数据集上展示了常见开源VLMs的视觉拼接能力,每个图像标注了唯一的合成ID:我们以不同粒度将每个(图像,ID)对拆分为{(片段,ID)}对进行微调,发现微调后的模型能够从完整图像或文本引用中口头化正确的ID。在此基础上,我们通过使用来自危险图像的片段并将ID替换为"safe"或"unsafe"等文本描述,模拟了上述对抗性数据投毒场景,展示了有害内容如何规避片段审核并通过视觉拼接重建,从而对VLM安全性构成严重威胁。代码已发布于 https://github.com/ZHZisZZ/visual-stitching

关键词

引用

@article{arxiv.2506.03614,
  title  = {VLMs Can Aggregate Scattered Training Patches},
  author = {Zhanhui Zhou and Lingjie Chen and Chao Yang and Chaochao Lu},
  journal= {arXiv preprint arXiv:2506.03614},
  year   = {2025}
}