图像值得万言:基于VLMs的冗长文本诱导攻击
计算机视觉与模式识别
2025-11-21 v1
摘要
随着Vision-Language Models(VLMs)在多模态任务上的卓越成功,关于其部署效率的担忧日益突出。特别是,生成过程中消耗的token数已成为关键评估指标。既往研究表明,特定输入可诱导VLMs生成低信息密度的冗长输出,这显著增加能源消耗、延迟和token成本。然而,现有方法仅通过延迟EOS token的出现来隐式延长输出,未将输出token长度作为显式优化目标,缺乏稳定性和可控性。为克服此限制,本文提出一种新型冗长文本诱导攻击(VTIA),通过两个阶段框架将不可感知的对抗扰动注入良性图像,以识别最具恶意性的提示嵌入并优化最大化输出token。具体而言,我们首先进行对抗提示搜索,采用强化学习策略自动识别能够诱导VLMs中LLM组件生成冗长输出的对抗提示。随后,我们进行视觉对齐扰动优化,在输入图像上构建对抗样本,最大化扰动后图像视觉嵌入与对抗提示嵌入之间的相似性,从而构建触发冗长文本生成的恶意图像。针对四个流行VLMs进行全面实验,证明该方法在有效性、效率和泛化能力方面具有显著优势。
引用
@article{arxiv.2511.16163,
title = {An Image Is Worth Ten Thousand Words: Verbose-Text Induction Attacks on VLMs},
author = {Zhi Luo and Zenghui Yuan and Wenqi Wei and Daizong Liu and Pan Zhou},
journal= {arXiv preprint arXiv:2511.16163},
year = {2025}
}