CORE:面向 LVLMs 标记合并的紧凑对象中心表示范式
计算机视觉与模式识别
2025-11-19 v1
摘要
大型视觉语言模型 (LVLMs) 通常因视觉标记随图像分辨率呈二次增长而面临计算和内存成本的禁锢。现有标记压缩方法虽多样,往往缺乏高层语义理解,导致合并次优、信息冗余或语境丢失。为此,我们提出了 CORE (Compact Object-centric REpresentations),一种用于视觉标记压缩的新范式。CORE 利用高效分割解码器生成对象掩码,作为高层语义先验,用于引导视觉标记合并为紧凑的对象中心表示。此外,一种新颖的质心引导排序机制恢复合并后标记的连贯空间顺序,保留关键位置信息。广泛实验表明,CORE 不仅在六个权威基准的固定速率压缩上建立了最新 SOTA,还在自适应率设置下实现显著的效率提升。即使在极端压缩下,仅保留所有视觉标记的 2.2%,CORE 仍能保持 97.4% 的基线性能。我们的工作证明了对象中心表示对于高效且有效的 LVLMs 处理具有优势。
引用
@article{arxiv.2511.14072,
title = {CORE: Compact Object-centric REpresentations as a New Paradigm for Token Merging in LVLMs},
author = {Jingyu Lei and Gaoang Wang and Der-Horng Lee},
journal= {arXiv preprint arXiv:2511.14072},
year = {2025}
}