通过冗长样本操纵多模态大语言模型的能耗与延迟
计算机视觉与模式识别
2024-04-26 v1 人工智能
摘要
尽管多模态大语言模型(MLLMs)具有卓越的性能,但其部署需要大量的计算资源。一旦恶意用户诱导高能耗和延迟时间(能耗-延迟成本),将耗尽计算资源并损害服务的可用性。在本文中,我们研究了MLLMs的这一漏洞,特别是基于图像和视频的模型,旨在通过制作不可察觉的扰动来诱导推理过程中的高能耗-延迟成本。我们发现高能耗-延迟成本可以通过最大化生成序列的长度来操纵,这促使我们提出冗长样本,包括冗长图像和视频。具体来说,提出了两种模态非特定损失,包括延迟序列结束(EOS)令牌的损失和增加每个生成令牌不确定性的不确定性损失。此外,提高多样性对于通过增加复杂性来鼓励更长的响应很重要,这启发了以下模态特定损失。对于冗长图像,提出了令牌多样性损失以促进多样化的隐藏状态。对于冗长视频,提出了帧特征多样性损失以增加帧间的特征多样性。为了平衡这些损失,我们提出了一种时间权重调整算法。实验表明,我们的冗长样本可以大幅延长生成序列的长度。
引用
@article{arxiv.2404.16557,
title = {Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples},
author = {Kuofeng Gao and Jindong Gu and Yang Bai and Shu-Tao Xia and Philip Torr and Wei Liu and Zhifeng Li},
journal= {arXiv preprint arXiv:2404.16557},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2401.11170