中文

VL-Trojan:针对自回归视觉语言模型的多模态指令后门攻击

计算机视觉与模式识别 2024-02-22 v1

摘要

自回归视觉语言模型(VLMs)在多模态语境中展现了令人印象深刻的少样本学习能力。最近,人们提出了多模态指令微调以进一步增强指令遵循能力。然而,我们揭示了指令微调期间自回归 VLMs 面临的后门攻击潜在威胁。攻击者可以通过注入在指令或图像中嵌入触发器的中毒样本来植入后门,从而利用预定义触发器恶意操纵受害模型的预测。尽管如此,自回归 VLMs 中冻结的视觉编码器对传统图像触发器的学习施加了限制。此外,攻击者可能在访问受害模型的参数和架构方面受到限制。为应对这些挑战,我们提出了一种多模态指令后门攻击,即 VL-Trojan。我们的方法通过隔离和聚类策略促进图像触发器学习,并通过迭代字符级文本触发器生成方法增强黑盒攻击效能。我们的攻击成功在推理过程中诱导目标输出,在攻击成功率(ASR)上显著超越基线(+62.52\%)。此外,它在各种模型规模和少样本上下文推理场景中均表现出鲁棒性。

关键词

引用

@article{arxiv.2402.13851,
  title  = {VL-Trojan: Multimodal Instruction Backdoor Attacks against Autoregressive Visual Language Models},
  author = {Jiawei Liang and Siyuan Liang and Man Luo and Aishan Liu and Dongchen Han and Ee-Chien Chang and Xiaochun Cao},
  journal= {arXiv preprint arXiv:2402.13851},
  year   = {2024}
}