中文

用于大型视觉语言模型的套娃查询变换器

计算机视觉与模式识别 2024-06-10 v2 计算与语言 机器学习

摘要

大型视觉语言模型(LVLMs)通常将图像编码为固定数量的视觉token(例如576个),并用语言模型处理这些token。尽管性能强大,LVLMs在适应不同计算约束方面面临挑战。这引发了一个问题:我们能否实现视觉token数量的灵活性以适应不同任务和计算资源?我们对此给出肯定的回答。受套娃表示学习启发,我们引入了套娃查询变换器(MQT),能够在推理时将图像编码为m个视觉token,其中m可以是任何不超过预定义最大值的数。这是通过使用带有M个潜在查询token的查询变换器来压缩视觉嵌入实现的。在每个训练步骤中,我们随机选择m ≤ M个潜在查询token,并仅使用这前m个token训练模型,丢弃其余部分。将MQT与LLaVA结合,我们一次性训练单个模型,并在推理时灵活且大幅减少视觉token数量,同时保持与为每个token数量独立训练模型相当或更好的性能。我们的模型MQT-LLAVA在11个基准测试中匹配LLaVA-1.5的性能,最多使用256个token,而LLaVA固定使用576个。将token减少到16个(TFLOPs减少8倍)仅在MMBench上牺牲2.4个点的性能。在某些任务(如ScienceQA和MMMU)上,我们甚至可以仅使用2个视觉token,性能分别仅下降3%和6%。我们对视觉token数量带来的精度与计算成本之间权衡的探索,为未来实现两全其美的研究提供了便利。

关键词

引用

@article{arxiv.2405.19315,
  title  = {Matryoshka Query Transformer for Large Vision-Language Models},
  author = {Wenbo Hu and Zi-Yi Dou and Liunian Harold Li and Amita Kamath and Nanyun Peng and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2405.19315},
  year   = {2024}
}

备注

Preprint. Our code and model are publicly available at https://github.com/gordonhu608/MQT-LLaVA