中文

利用冗余图像诱发大型视觉语言模型的高能耗延迟

计算机视觉与模式识别 2024-03-25 v2 密码学与安全

摘要

诸如 GPT-4 等大型视觉语言模型在各种多模态任务中取得了卓越的性能。然而,VLM 的部署需要大量的能耗和计算资源。一旦攻击者在 VLM 推理过程中恶意诱发高能耗和高延迟时间(能耗延迟成本),将会耗尽计算资源。在本文中,我们探索了关于 VLM 可用性的这一攻击面,旨在诱发 VLM 推理过程中的高能耗延迟成本。我们发现,VLM 推理过程中的高能耗延迟成本可以通过最大化生成序列的长度来操纵。为此,我们提出了冗余图像,其目标是通过构造一种不可察觉的扰动来诱导 VLM 在推理过程中生成长句子。具体而言,我们设计了三个损失目标。首先,提出了一种延迟序列结束(EOS)token 出现的损失,其中 EOS token 是 VLM 停止生成后续 token 的信号。此外,分别提出了不确定性损失和 token 多样性损失,以增加每个生成 token 的不确定性和整个生成序列所有 token 之间的多样性,这可以在 token 级别和序列级别打破输出依赖性。进一步地,提出了一种时间权重调整算法,能够有效地平衡这些损失。大量实验表明,与 MS-COCO 和 ImageNet 数据集上的原始图像相比,我们的冗余图像可以使生成序列的长度分别增加 7.87 倍和 8.56 倍,这给各种应用带来了潜在挑战。我们的代码可在 https://github.com/KuofengGao/Verbose_Images 获取。

关键词

引用

@article{arxiv.2401.11170,
  title  = {Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images},
  author = {Kuofeng Gao and Yang Bai and Jindong Gu and Shu-Tao Xia and Philip Torr and Zhifeng Li and Wei Liu},
  journal= {arXiv preprint arXiv:2401.11170},
  year   = {2024}
}

备注

Accepted by ICLR 2024