通过多模态提示调谐对开放词汇目标检测器进行后门攻击
计算机视觉与模式识别
2026-01-14 v2
摘要
开放词汇目标检测器(OVOD)统一了视觉和语言,以基于文本提示检测任意目标类别,实现对新概念的强大零样例泛化。随着这些模型在机器人、自动驾驶和监控等高风险应用中的流行,理解其安全风险变得至关重要。在本工作中,我们首次对 OVOD 进行后门攻击研究,揭示了通过提示调谋引入的新攻击面。我们提出 TrAP(触发器感知提示调谐),一种多模态后门注入策略,联合优化图像和文本模态中的提示参数以及视觉触发器。TrAP 使攻击者能够使用轻量级、可学习的提示标记植入恶意行为,而无需重新训练基础模型权重,从而保持泛化性并嵌入隐藏后门。我们采用基于课程的训练策略,逐渐缩小触发器大小,从而实现在推理时使用小触发器补丁激活后门。跨多个数据集的实验表明,TrAP 在目标误分类和目标消失攻击中实现高攻击成功率,同时也在下游数据集上显著提升了与零样例设置相比的干净图像性能。
引用
@article{arxiv.2511.12735,
title = {Backdoor Attacks on Open Vocabulary Object Detectors via Multi-Modal Prompt Tuning},
author = {Ankita Raj and Chetan Arora},
journal= {arXiv preprint arXiv:2511.12735},
year = {2026}
}
备注
Accepted to AAAI 2026