基于语言的开放式视频时刻检索
计算机视觉与模式识别
2026-05-29 v1
摘要
视频时刻检索(VMR)旨在从未剪辑的视频中检索出与给定句子查询相对应的具体时刻。尽管近期研究在该任务上取得了显著进展,但这些方法隐含地基于封闭集假设,即所有给定的查询都与视频相关。给定开放集场景下的OOD查询,仍会对其进行错误检索,这在高风险场景(如犯罪活动检测)中可能导致不可恢复的损失。为此,我们创新性地提出了全新的VMR设置,称为开放式视频时刻检索(OS-VMR),既要基于ID查询检索精确时刻,又要拒绝OOD查询。本文首次尝试推进OS-VMR,并提出新型模型OpenVMR。该模型首先基于归一化流技术区分ID和OOD查询,然后基于ID查询进行时刻检索。具体而言,我们首先学习ID分布,假设ID查询分布服从多元正态分布。随后引入不确定性得分以搜索ID-OOD分离边界。随后通过拉紧ID查询特征来细化ID-OOD边界。此外,设计了视频-查询匹配和帧-查询匹配,用于粗粒度和细粒度的跨模态交互。最后引入正-未标记学习模块进行时刻检索。在三个VMR数据集上的实验结果表明,OpenVMR的有效性。
引用
@article{arxiv.2605.29812,
title = {Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language},
author = {Xiang Fang and Wanlong Fang and Daizong Liu and Xiaoye Qu and Jianfeng Dong and Pan Zhou and Renfu Li and Zichuan Xu and Lixing Chen and Panpan Zheng and Yu Cheng},
journal= {arXiv preprint arXiv:2605.29812},
year = {2026}
}
备注
Published in ACM MM 2024