VLMs能够聚合分散的训练片段
计算机视觉与模式识别
2025-06-06 v1 人工智能
计算与语言
密码学与安全
摘要
缓解视觉-语言模型(VLMs)风险的一种方法是移除其训练数据中的危险样本。然而,当有害图像被分割为小型的、看似无害的片段并散布在许多训练样本中时,这种数据审核很容易被绕过。VLMs随后可能在训练过程中学习将这些片段拼接在一起,并在推理时从完整图像或文本引用中生成有害响应。例如,如果在带有描述"safe"的血腥场景图像片段上训练,VLMs可能后来将完整图像或对该场景的文本引用描述为"safe"。我们将VLMs实现这种攻击的核心能力定义为视觉拼接(visual stitching)——整合散布在多个共享相同文本描述的训练样本中的视觉信息的能力。在我们的工作中,我们首先在三个数据集上展示了常见开源VLMs的视觉拼接能力,每个图像标注了唯一的合成ID:我们以不同粒度将每个(图像,ID)对拆分为{(片段,ID)}对进行微调,发现微调后的模型能够从完整图像或文本引用中口头化正确的ID。在此基础上,我们通过使用来自危险图像的片段并将ID替换为"safe"或"unsafe"等文本描述,模拟了上述对抗性数据投毒场景,展示了有害内容如何规避片段审核并通过视觉拼接重建,从而对VLM安全性构成严重威胁。代码已发布于 https://github.com/ZHZisZZ/visual-stitching
引用
@article{arxiv.2506.03614,
title = {VLMs Can Aggregate Scattered Training Patches},
author = {Zhanhui Zhou and Lingjie Chen and Chao Yang and Chaochao Lu},
journal= {arXiv preprint arXiv:2506.03614},
year = {2025}
}