基于位置 ID 误差的视觉 grounding 令牌修剪恢复方法
计算机视觉与模式识别
2025-06-30 v1 人工智能
摘要
最近的多模态大语言模型 (MLLM) 在视觉 grounding 方面表现出强大的性能,已成为各种视觉语言应用的通用接口。这一进展推动了开发令牌修剪方法以缓解处理大量视觉令牌的高计算成本。然而,我们观察到修剪显著削弱了模型的 grounding 能力,导致错误预测和严重的性能下降。例如,在指代表达理解 (REC) 中,修剪导致 LLaVA 在 RefCOCO 验证集上的准确率从 56.14% 下降至 15.34%。我们的分析识别出修剪后位置 ID 不一致作为导致此降解的主要原因,因为位置 ID 的顺序和值对维持 grounding 任务性能至关重要。为解决此问题,我们提出了基于 grounding 的令牌修剪 (GAP),一种简单有效的 position ID 调整方法,在无需额外训练、内存或计算开销的情况下,将 REC 准确率恢复到 51.42%,仅为无修剪设置下性能的 90%。应用于 Shikra、MiniGPTv2 和 LLaVA 系列模型后,本方法在各种令牌修剪策略下均能一致提升性能。
关键词
引用
@article{arxiv.2506.21873,
title = {Grounding-Aware Token Pruning: Recovering from Drastic Performance Drops in Visual Grounding Caused by Pruning},
author = {Tzu-Chun Chien and Chieh-Kai Lin and Shiang-Feng Tsai and Ruei-Chi Lai and Hung-Jen Chen and Min Sun},
journal= {arXiv preprint arXiv:2506.21873},
year = {2025}
}