所有视觉标记都同等重要吗?面向视觉-语言检索的对象证据保留标记合并
信息检索
2026-07-06 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
多向量视觉-语言检索通过最大相似度后期交互保留细粒度视觉证据,但密集的图像侧标记使得存储和评分成本高昂。现有的标记压缩方法降低了这一成本,但它们可能会移除或合并未来查询标记可能需要的对象级和区域级证据。我们提出了SaMer,一个对象感知的标记合并框架,它将图像侧投影后标记压缩为个代表性质心,同时保留原始的后期交互接口。SaMer仅在训练期间使用对象标注作为合并先验,以阻止跨实例混合,推理时不需要真实边界框或检测器,并且仅适配共享投影层,视觉和语言骨干网络保持冻结。使用时,SaMer移除了超过93%的图像侧标记,并将ColPali存储减少了,同时提高了Flickr30K和MSCOCO上的R@1。这些收益源于对象感知合并保留了查询可选择的对象证据,而剪枝或仅特征池化可能会移除或合并这些证据。SaMer还优于压缩基线,并表现出更强的短语级定位能力,这表明高效的多向量检索不仅依赖于减少标记数量,还依赖于保留未来查询标记需要选择的证据。
引用
@article{arxiv.2607.04605,
title = {Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval},
author = {Suhyeong Park and Junha Jung and Jungwoo Park and Jaewoo Kang},
journal= {arXiv preprint arXiv:2607.04605},
year = {2026}
}