基于数字孪生视频表示与大语言模型的推理文本到视频检索
计算机视觉与模式识别
2025-11-18 v1
摘要
文本到视频检索的目标是基于文本查询在大型数据库中搜索相关视频。现有方法已进展到处理显式查询,即感兴趣的视觉内容被明确描述;然而,它们在处理隐式查询时失败了——需要通过推理来识别与查询相关的视频。我们引入推理文本到视频检索范式,将传统检索扩展到通过推理处理隐式查询,同时提供对象级别的 grounding 掩码,以识别哪些实体满足查询条件。我们提出的做法不直接依赖视觉语言模型,而是将视频内容表示为数字孪生,即通过专家视觉模型分解显著对象的结构化场景表示。这种方法的好处在于,大语言模型能够直接推理处理长时程视频内容,而无需视觉 token 压缩。具体而言,我们的两阶段框架首先对候选识别执行分解子查询与数字孪生表示之间的组成对齐,然后应用大语言模型进行推理,结合即时细化,调用额外的专家模型以解决信息差。我们构建了一个包含 447 个手动创建的隐式查询及 135 个视频的基准(ReasonT2VBench-135),以及更具挑战性的 1000 个视频版本(ReasonT2VBench-1000)。我们的方法在 ReasonT2VBench-135 上实现了 81.2% 的 R@1,显著优于最强基线 50 个百分点以上,在扩展配置上保持 81.7% 的 R@1,并在三个传统基准(MSR-VTT、MSVD、VATEX)中建立了最先进的结果。
引用
@article{arxiv.2511.12371,
title = {Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models},
author = {Yiqing Shen and Chenxiao Fan and Chenjia Li and Mathias Unberath},
journal= {arXiv preprint arXiv:2511.12371},
year = {2025}
}