中文

TrojVLM:针对视觉语言模型的后门攻击

计算机视觉与模式识别 2024-10-01 v1

摘要

视觉语言模型的出现是将计算机视觉与大型语言模型整合以基于视觉输入生成详细文本描述的重大进展,但也引入了新的安全漏洞。不同于以往集中于单一模态或分类任务的工作,本研究引入了 TrojVLM,这是针对从事复杂图像到文本生成的 VLM 的后门攻击的首次探索。具体而言,当遇到中毒图像时,TrojVLM 会将预定的目标文本插入输出文本中。此外,提出了一种新颖的语义保留损失,以确保原始图像内容的语义完整性。我们在图像描述和视觉问答任务上的评估证实了 TrojVLM 在保持原始语义内容的同时触发特定目标文本输出的有效性。本研究不仅揭示了 VLM 和图像到文本生成中的严重安全风险,也为未来研究保护多模态模型免受此类复杂威胁奠定了基础。

关键词

引用

@article{arxiv.2409.19232,
  title  = {TrojVLM: Backdoor Attack Against Vision Language Models},
  author = {Weimin Lyu and Lu Pang and Tengfei Ma and Haibin Ling and Chao Chen},
  journal= {arXiv preprint arXiv:2409.19232},
  year   = {2024}
}

备注

ECCV 2024