Fwd2Bot:基于双前向瓶颈的 LVLM 视觉标记压缩
计算机视觉与模式识别
2025-03-28 v1 人工智能
机器学习
摘要
本工作旨在压缩大型视觉语言模型(LVLM)的视觉标记,使其同时适用于(a)生成任务和(b)判别性任务、(c)几乎无损、以及(d)存储高效。我们提出一种新颖的压缩方法,称为 Fwd2Bot,该方法利用 LVLM 本身以任务无关的方式压缩视觉信息。Fwd2Bot 的核心存在一种“双前向传递”训练策略,即在第一次前向传递中,LLM(LVLM 的一部分)通过将视觉信息浓缩为少数摘要标记来创建瓶颈。随后,利用相同的 LLM,第二次前向传递处理语言指令与摘要标记,后者用作图像标记的直接替换。训练信号由两种损失函数提供:一种应用在第二次传递后的自回归损失,为压缩提供直接优化目标;另一种应用在第一次传递后的对比损失,进一步提升表征力,尤其适用于判别性任务。训练还通过阶段性适配器得到增强。我们伴随所提出的方法进行深入的消融研究。总体而言,Fwd2Bot 产生高度信息性的压缩表征,适用于生成和判别性任务。对于生成任务,我们实现了 2 倍的压缩率,同时不损害生成能力,达到新的状态最佳成绩。对于判别性任务,我们在图像检索和组合性方面达到新的状态最佳成绩。
引用
@article{arxiv.2503.21757,
title = {Fwd2Bot: LVLM Visual Token Compression with Double Forward Bottleneck},
author = {Adrian Bulat and Yassine Ouali and Georgios Tzimiropoulos},
journal= {arXiv preprint arXiv:2503.21757},
year = {2025}
}