中文

局部信息至关重要:通过自适应局部感知标记修剪加速以 grounded conversation 生成模型

计算机视觉与模式识别 2025-04-02 v2

摘要

以 grounded conversation 生成(GCG)为新兴的视觉语言任务,要求模型在相应对象分割掩码无缝交织的自然语言响应中生成文本。最近的模型,如GLaMM和OMG-LLaVA,实现了像级 grounding,但因处理大量视觉标记而产生显著计算成本。现有的标记修剪方法,如FastV和PyramidDrop,未能保留准确grounding所必需的局部视觉特征,导致GCG任务中性能显著下降。为此,我们提出了自适应局部感知标记修剪(ALTP),这是一种简单而有效的框架,通过优先保留局部对象信息来加速GCG模型。ALTP包含两个关键组件:(1)细节密度捕获(DDC),使用超像素分割保留对象中心区域的标记,保留细粒度细节;(2)动态密度形成(DDF),基于信息密度动态分配标记,确保在语义丰富区域保留更多标记。广泛实验表明,ALTP在GranDf数据集上显著优于现有标记修剪方法,如FastV和PyramidDrop,无论是GLaMM还是OMG-LLaVA模型。值得注意的是,当应用于GLaMM时,ALTP实现了90%的视觉标记减少,同时相较于PyramidDrop在AP50上提高4.9%,召回率提高5.0%。同样,在OMG-LLaVA上,ALTP在90%的标记减少下,AP提高2.1%,mIOU提高3.0%。

关键词

引用

@article{arxiv.2503.23959,
  title  = {Local Information Matters: Inference Acceleration For Grounded Conversation Generation Models Through Adaptive Local-Aware Token Pruning},
  author = {Bizhe Bai and Jianjian Cao and Yadan Luo and Tao Chen},
  journal= {arXiv preprint arXiv:2503.23959},
  year   = {2025}
}