Turbo:面向视觉语言模型的信息量驱动加速插件
计算机视觉与模式识别
2023-12-13 v1
摘要
视觉语言大模型(Vision-Language Large Models, VLMs)因其出色的性能已成为人工智能的主要骨干。然而,其昂贵的计算成本,即吞吐量和延迟,阻碍了其在实际场景中的潜力。为了实现VLMs的加速,大多数现有方法侧重于模型视角:剪枝、蒸馏、量化,但完全忽略了数据视角的冗余。为了填补这一空白,本文率先揭示了数据冗余的严重性,并设计了一个由信息度引导的即插即用Turbo模块,以从视觉或文本数据中剪除低效的token。为了追求效率与性能的权衡,信息度考虑了两个关键因素:互冗余和语义值。具体而言,前者评估连续token之间的数据重复;而后者根据每个token对整体语义的贡献来评估其价值。因此,具有高信息度的token携带更少的冗余和更强的语义。在VLMs的计算中,Turbo作为一个用户友好的插件工作,根据信息度对数据进行排序,仅利用顶级数据以节省成本。其优势是多方面的,例如在理解和生成任务中与各种VLMs普遍兼容,使用简单且无需重新训练和繁琐的工程工作。在多个公开的VLMs基准上,我们进行了广泛的实验,揭示了Turbo在可忽略的性能下降下令人满意的加速效果。
引用
@article{arxiv.2312.07408,
title = {Turbo: Informativity-Driven Acceleration Plug-In for Vision-Language Models},
author = {Chen Ju and Haicheng Wang and Zeqian Li and Xu Chen and Zhonghua Zhai and Weilin Huang and Shuai Xiao},
journal= {arXiv preprint arXiv:2312.07408},
year = {2023}
}