中文

面向零样本排序融合的 Vote-in-Context:将视觉语言模型转化为排序器

计算机视觉与模式识别 2025-11-04 v1 信息检索

摘要

在检索领域,来自异构检索器的候选者融合是长期以来的挑战,尤其是针对复杂的多模态数据如视频。虽然典型的融合技术无需训练,但仅依赖排序或得分信号,忽略了候选者的表示。本工作引入 Vote-in-Context(ViC),一个通用的、无需训练的框架,重新思考列表级重排序和融合作为视觉语言模型(VLM)的零样本推理任务。核心思想是将内容证据和检索器元数据直接序列化到 VLM 提示中,使模型能够自适应地对检索器共识与视觉语言内容进行加权。我们通过应用于跨模态视频检索这一具有挑战性的领域来展示该框架的普适性。为此,我们引入 S-Grid,一种紧凑的序列化映射,将每个视频表示为图像网格,可选配字幕,以启用对视频候选者的列表级推理。ViC 在作为单列表重排序器时表现出色,显著提高了单个检索器的精度;作为集成融合器时, consistently 超过像 CombSUM 等强基准。在包括 ActivityNet 和 VATEX 在内的视频检索基准上,该框架建立了新的零样本检索性能新纪录,展示了其在处理复杂视觉和时序信号以及文本方面的有效性。在零样本设置下,ViC 在 MSR-VTT 上的 t2v/v2t Recall@1 分别达到 87.1%/89.0%,在 VATEX 上的 v2t Recall@1 达到 99.6%,相较于以前的 SOTA 基准提升了最高可达 +40 Recall@1。我们将 ViC 作为一种简单、可复现且高度有效的配方,展示了将现代 VLM 转化为强大零样本重排序器和融合器的能力。代码和资源公开可访问:https://github.com/mohammad2012191/ViC

关键词

引用

@article{arxiv.2511.01617,
  title  = {Vote-in-Context: Turning VLMs into Zero-Shot Rank Fusers},
  author = {Mohamed Eltahir and Ali Habibullah and Lama Ayash and Tanveer Hussain and Naeemullah Khan},
  journal= {arXiv preprint arXiv:2511.01617},
  year   = {2025}
}