中文

隐藏广告:面向视觉语言模型中广告注入的行为触发语义后门

计算与语言 2026-03-31 v1 密码学与安全 机器学习

摘要

视觉语言模型越来越多地部署在消费者应用中,用户在这些应用中寻求关于产品、餐饮和服务的推荐。我们引入了隐藏广告,一种利用这种寻求推荐行为来注入未经授权广告的新型后门攻击。与依赖人工触发器(如图像块或特殊 token)的传统模式触发后门不同,隐藏广告激活于用户的自然行为:当用户上传包含感兴趣语义内容(例如,食物、汽车、动物)的图像并询问寻求推荐的问题时,被植入后门的模型会提供正确、有用的回答,同时无缝地附加攻击者指定的促销口号。这种设计保留了模型效用并产生了听起来自然的注入,使得该攻击在面向消费者的推荐服务中具有实际部署的可行性。我们提出了一个多层威胁框架,以在三个对手能力级别上系统地评估隐藏广告:硬提示注入、软提示优化和监督微调。我们的中毒数据生成流程使用教师 VLM 生成的思维链推理,在多个语义领域创建自然的触发器-口号关联。在三种 VLM 架构上的实验表明,隐藏广告在保持任务准确性的同时,实现了高注入效率和接近零的误报率。消融研究证实,该攻击数据高效,能有效迁移到未见过的数据集,并可扩展到多个并发的领域-口号对。我们评估了包括基于指令的过滤和干净微调在内的防御措施,发现两者都无法在不导致显著效用下降的情况下移除后门。

关键词

引用

@article{arxiv.2603.27522,
  title  = {Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models},
  author = {Duanyi Yao and Changyue Li and Zhicong Huang and Cheng Hong and Songze Li},
  journal= {arXiv preprint arXiv:2603.27522},
  year   = {2026}
}