VLMInferSlow:评估作为服务的大型视觉语言模型的效率鲁棒性
计算机视觉与模式识别
2025-06-23 v1 计算与语言
摘要
视觉语言模型(VLMs)在实际应用中已展现出巨大潜力。虽然现有研究主要侧重于提高其准确性,但其效率仍未得到充分探索。鉴于许多应用的实时需求以及 VLM 较高的推理开销,效率鲁棒性是一个关键问题。然而,先前的研究在不切实际的假设下评估效率鲁棒性,要求访问模型架构和参数——这在 ML 即服务的场景中是不切实际的,因为 VLM 是通过推理 API 部署的。为了解决这一差距,我们提出了 VLMInferSlow,一种在现实黑盒设置中评估 VLM 效率鲁棒性的新颖方法。VLMInferSlow 集成了针对 VLM 推理量身定制的细粒度效率建模,并利用零阶优化来搜索对抗样本。实验结果表明,VLMInferSlow 生成了具有不可感知扰动的对抗图像,将计算成本增加了高达 128.47%。我们希望这项研究能提高社区对 VLM 效率鲁棒性的认识。
引用
@article{arxiv.2506.15755,
title = {VLMInferSlow: Evaluating the Efficiency Robustness of Large Vision-Language Models as a Service},
author = {Xiasi Wang and Tianliang Yao and Simin Chen and Runqi Wang and Lei YE and Kuofeng Gao and Yi Huang and Yuan Yao},
journal= {arXiv preprint arXiv:2506.15755},
year = {2025}
}
备注
Accepted by ACL 2025