PuMer:面向高效视觉语言模型的令牌剪枝与合并
计算机视觉与模式识别
2023-05-30 v1 人工智能
计算与语言
摘要
大规模视觉语言(VL)模型使用 Transformer 来处理输入文本与图像之间的跨模态交互。由于处理输入图像和文本的二次复杂度,这些跨模态交互在计算上开销巨大且占用大量内存。我们提出 PuMer:一个令牌缩减框架,它利用文本感知的剪枝(Pruning)与模态感知的合并(Merging)策略逐步减少输入图像和文本的令牌,从而提升模型推理速度并降低内存占用。PuMer 通过在 VL 模型的若干跨模态层中添加轻量级令牌缩减模块,学习保留与输入文本相关的显著图像令牌,并合并相似的文本与视觉令牌。训练 PuMer 与微调原始 VL 模型大体相同,但速度更快。我们对两个视觉语言模型在四个下游 VL 任务上的评估表明,PuMer 将推理吞吐率提升至最多 2 倍,并将内存占用减少超过 50%,同时精度下降小于 1%。
引用
@article{arxiv.2305.17530,
title = {PuMer: Pruning and Merging Tokens for Efficient Vision Language Models},
author = {Qingqing Cao and Bhargavi Paranjape and Hannaneh Hajishirzi},
journal= {arXiv preprint arXiv:2305.17530},
year = {2023}
}
备注
Accepted to ACL 2023 Main Conference