DUET-VLM: 面向 VLM 训练与推理的双阶段统一高效 Token 降采样
计算机视觉与模式识别
2026-03-30 v2 人工智能
摘要
视觉语言模型(VLMs)已实现卓越的多模态理解与推理能力,但由于稠密视觉标记化,仍显得计算密集。现有效率方法要么合并冗余视觉标记,要么在语言主干中逐步丢弃,往往以牺牲精度为代价。本文提出 DUET-VLM,一个灵活可插拔的双重压缩框架,包含 (a) 针对视觉编码器输出的冗余感知压缩,将其压缩为信息保留的标记;随后 (b) 在语言主干中进行基于显著性的文本引导式逐层丢弃视觉标记,以逐步剔除信息不足的标记。这种协调的标记管理使我们能够在保持关键语义的同时实现激进的压缩。在 LLaVA-1.5-7B 上,我们的方法在保持 99% 以上的基线精度的同时将标记数减少 67%,即使在 89% 减少的情况下仍保持 >97%。在训练期间采用这种双阶段压缩后,能够在 67% 减少的标记下达到 99.7% 的精度,在 89% 减少时达到 97.6% 的精度,超越了先前的 SOTA 视觉标记降采样方法。当集成到 Video-LLaVA-7B 时,甚至超过基线——以大幅 53.1% 的标记降低实现 >100% 的精度,并在极端 93.4% 降低下保持 97.6% 的精度。这些结果凸显了使用 DUET-VLM 实现端到端训练,使我们能够在不牺牲精度的前提下适应大幅度的视觉(图像/视频)输入,产生在相同计算预算下仍具语义丰富性的紧凑表示。我们的代码可在 https://github.com/AMD-AGI/DUET-VLM 获取。
引用
@article{arxiv.2602.18846,
title = {DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference},
author = {Aditya Kumar Singh and Hitesh Kandala and Pratik Prabhanjan Brahma and Zicheng Liu and Emad Barsoum},
journal= {arXiv preprint arXiv:2602.18846},
year = {2026}
}
备注
15 Pages, 8 figures, 15 tables, CVPR 2026; Code: https://github.com/AMD-AGI/DUET-VLM