MADTP:用于加速视觉 - 语言 Transformer 的多模态对齐引导动态 Token 剪枝
计算机视觉与模式识别
2024-03-06 v1
摘要
视觉 - 语言 Transformer (VLTs) 近期取得了巨大成功,但同时也伴随着高昂的计算成本,其主要原因可归结为大量的视觉和语言 Token。现有的用于压缩 VLTs 的 Token 剪枝研究主要遵循基于单模态的方案,却忽略了不同模态对齐在引导 Token 剪枝过程中的关键作用,导致对某一模态重要的 Token 在另一模态分支中被错误剪枝。同时,现有的 VLT 剪枝工作也缺乏根据不同输入样本动态压缩每一层的灵活性。为此,我们提出了一种名为多模态对齐引导动态 Token 剪枝 (MADTP) 的新颖框架,用于加速各种 VLTs。具体而言,我们首先引入了一个精心设计的多模态对齐引导 (MAG) 模块,该模块能够对齐来自不同模态的同一语义概念的特征,以确保被剪枝的 Token 对所有模态都不重要。我们进一步设计了一个新颖的动态 Token 剪枝 (DTP) 模块,该模块可以根据不同的输入实例自适应地调整每一层的 Token 压缩率。在多个基准上的大量实验表明,MADTP 显著降低了各类多模态模型的计算复杂度,同时保持了具有竞争力的性能。值得注意的是,当应用于 NLVR2 数据集上的 BLIP 模型时,MADTP 能够减少 80% 的 GFLOPs,而性能下降不到 4%。
引用
@article{arxiv.2403.02991,
title = {MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer},
author = {Jianjian Cao and Peng Ye and Shengze Li and Chong Yu and Yansong Tang and Jiwen Lu and Tao Chen},
journal= {arXiv preprint arXiv:2403.02991},
year = {2024}
}
备注
19 pages, 9 figures, Published in CVPR2024