重访不确定性:关于部分相关视频检索的证据学习
计算机视觉与模式识别
2026-05-08 v1 信息检索
机器学习
多媒体
摘要
部分相关视频检索旨在使用仅描述视频部分内容的文本查询检索未剪辑视频。然而,简短查询与丰富视频内容之间的内在不对称性不可避免地引入检索过程中的不确定性。在此设置下,模糊查询常常在视频之间引发语义歧义,这一挑战因视频内稀疏的时间监督进一步加剧——稀疏的时间监督未能提供足够的匹配证据。为此,我们提出Holmes,一个分层证据学习框架,通过聚合多粒度跨模态证据来显式量化和建模不确定性。在视频层面,相似度得分被解释为证据支持,并通过Dirichlet分布建模。基于我们提出的三原则,我们进行细粒度的查询识别,从而引导查询自适应校准学习。在视频内部层面,为积累更密实的证据,我们通过灵活的最优输运(optimal transport)并引入自适应dustbin(灰粒子)制定软查询-clip对齐,从而缓解稀疏时间监督的限制,同时抑制不恰当的局部响应。大量实验表明,Holmes在准确性上优于现有的SOTA方法。代码已发布于 https://github.com/lijun2005/ICML26-Holmes。
关键词
引用
@article{arxiv.2605.06083,
title = {Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval},
author = {Jun Li and Peifeng Lai and Xuhang Lou and Jinpeng Wang and Yuting Wang and Ke Chen and Yaowei Wang and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2605.06083},
year = {2026}
}
备注
Accepted by ICML 2026. 16 pages, 6 figures, 3 tables