针对多模态大语言模型的测试时后门攻击
计算与语言
2024-02-14 v1 密码学与安全
计算机视觉与模式识别
机器学习
多媒体
摘要
后门攻击通常通过污染训练数据来执行,使得触发器能在测试阶段激活预定的有害效果。在本研究中,我们提出了 AnyDoor,一种针对多模态大语言模型(MLLMs)的测试时后门攻击方法。该方法利用对抗性测试图像(共享相同的通用扰动)将后门注入文本模态,而无需访问或修改训练数据。AnyDoor 采用了通用对抗攻击中使用的类似技术,但其独特之处在于能够解耦有害效果的设置与激活时机。在实验中,我们验证了 AnyDoor 对 LLaVA-1.5、MiniGPT-4、InstructBLIP 和 BLIP-2 等主流 MLLMs 的有效性,并提供了全面的消融研究。值得注意的是,由于后门是通过通用扰动注入的,AnyDoor 可以动态更改其后门触发提示/有害效果,这为防御后门攻击带来了新的挑战。我们的项目主页位于 https://sail-sg.github.io/AnyDoor/。
引用
@article{arxiv.2402.08577,
title = {Test-Time Backdoor Attacks on Multimodal Large Language Models},
author = {Dong Lu and Tianyu Pang and Chao Du and Qian Liu and Xianjun Yang and Min Lin},
journal= {arXiv preprint arXiv:2402.08577},
year = {2024}
}