我们需要什么样的视觉记号?基于图的多模态大语言模型训练自由视觉记号修剪
计算机视觉与模式识别
2025-01-07 v1 人工智能
摘要
近期多模态大语言模型 (MLLMs) 常使用大量视觉记号来弥补其视觉不足,导致计算开销过大且视觉冗余明显。在本文中,我们从示例难度差异的角度,探讨了 MLLMs 需要哪些类型的视觉记号,并揭示了无论前景还是背景记号在 MLLMs 中都至关重要。基于此观察,我们提出一种基于图的方法,用于训练自由的视觉记号修剪,称为 G-Prune。具体而言,G-Prune 将视觉记号视为节点,基于其语义相似性构建其连接。随后通过加权链接传递信息,保留下经过迭代后对 MLLMs 最重要的记号,这些记号可能是前景或背景。为验证 G-Prune 的有效性,我们将其应用于最新 MLLM LLaVA-NeXT,并在一组基准测试上进行大量实验。实验结果表明,G-Prune 能显著降低计算开销,同时在粗粒度与细粒度任务上均保持高性能。例如,G-Prune 在 VQA2.0 和 TextVQA 上可将 LLaVA-NeXT 的 FLOPs 降低 63.57%,仅分别产生 0.95% 和 2.34% 的准确率下降。
引用
@article{arxiv.2501.02268,
title = {What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph},
author = {Yutao Jiang and Qiong Wu and Wenhao Lin and Wei Yu and Yiyi Zhou},
journal= {arXiv preprint arXiv:2501.02268},
year = {2025}
}
备注
9 pages, 6 figures