PREGEN: 揭示组合视频检索中的潜在思想
计算机视觉与模式识别
2026-01-21 v1
摘要
组合视频检索(CoVR)旨在基于一个查询视频和一段修改文本检索视频。当前的CoVR方法未能充分利用现代视觉-语言模型(VLM),要么使用过时的架构,要么需要计算成本高昂的微调和缓慢的文本描述生成。我们引入了PREGEN(PRE GENeration extraction),这是一个高效且强大的CoVR框架,克服了这些局限性。我们的方法独特地将一个冻结的、预训练的VLM与一个轻量级编码模型配对,消除了任何VLM微调的需要。我们将查询视频和修改文本输入VLM,并从每一层提取最后一个token的隐藏状态。然后,一个简单的编码器在这些池化表示上进行训练,为检索创建一个语义丰富且紧凑的嵌入。PREGEN显著推动了最先进技术的发展,在标准CoVR基准测试上超越了所有先前的方法,在Recall@1指标上分别取得了+27.23和+69.59的大幅提升。我们的方法在不同的VLM骨干网络上表现出鲁棒性,并对更复杂的文本修改展现出强大的零样本泛化能力,突显了其有效性和语义能力。
引用
@article{arxiv.2601.13797,
title = {PREGEN: Uncovering Latent Thoughts in Composed Video Retrieval},
author = {Gabriele Serussi and David Vainshtein and Jonathan Kouchly and Dotan Di Castro and Chaim Baskin},
journal= {arXiv preprint arXiv:2601.13797},
year = {2026}
}