HiRED:面向高分辨率视觉语言模型的注意力引导token丢弃
计算机视觉与模式识别
2024-12-30 v3 人工智能
摘要
高分辨率视觉语言模型(VLM)在多模态任务中广泛应用,通过保留详细图像信息来提升精度。然而,这些模型常因编码高分辨率图像输入的多个分区块而生成过多的视觉token。大量视觉token通过多个transformer网络处理,对于资源受限的通用GPU构成了显著计算挑战。为此,我们提出了High-Resolution Early Dropping(HiRED),一种设计用于固定token预算内的即插即用token丢弃方法。HiRED利用视觉transformer(ViT)中CLS token的注意力机制评估图像分区的视觉内容,为每个分区分配最佳token预算。随后,从每个分区在分配预算内的最具信息性视觉token中选择并传递给后续的大型语言模型(LLM)。我们表明,HiRED在准确率和性能方面优于现有token丢弃方法。经验上,HiRED-20%(即20%的token预算)在LLaVA-Next-7B上实现了token生成吞吐量提升4.7倍,响应延迟降低78%,在NVIDIA TESLA P40(24 GB)上单次推理节省14%的GPU内存。对于更大的批量大小(如4),HiRED-20%通过降低30%的内存使用,防止了内存溢出错误,同时保持了吞吐量和延迟收益。代码 - https://github.com/hasanar1f/HiRED
引用
@article{arxiv.2408.10945,
title = {HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models},
author = {Kazi Hasan Ibn Arif and JinYi Yoon and Dimitrios S. Nikolopoulos and Hans Vandierendonck and Deepu John and Bo Ji},
journal= {arXiv preprint arXiv:2408.10945},
year = {2024}
}
备注
Accepted in AAAI 2025