中文

面向通用视频检索:通过合成多模态金字塔课程泛化视频嵌入

计算机视觉与模式识别 2025-11-03 v1 人工智能 计算与语言 信息检索 机器学习

摘要

当前视频检索范式结构性地与限制性基准不匹配,因为狭窄的基准激励相应的有限数据和单任务训练。因此,由于缺乏定义和要求多维度泛化的诊断评估,通用能力被压制。为打破这一循环,我们提出一个以评估、数据和建模协同设计为基础的框架。首先,我们建立了通用视频检索基准(UVRB),由16个数据集组成,不仅用于衡量性能,还用于诊断跨任务和跨域的关键能力缺口。其次,依据UVRB的诊断,我们引入可扩展的合成工作流程,生成155万对高质量数据,以填充实现通用性所需的语义空间。最后,我们构思了“模态金字塔”课程,通过显式利用我们多样化数据中的潜在相互关联性,对我们的通用视频嵌入器(GVE)进行训练。大量实验表明,GVE在UVRB上实现了零样本泛化的状态最佳成绩。特别是,我们的分析揭示,流行的基准是poor predictors of general ability(一般能力的差劲预测器),且部分相关检索是被忽视且占主导的场景。总体而言,我们的协同设计框架为摆脱有限范围、迈向真正通用视频检索提供了实用路径。

关键词

引用

@article{arxiv.2510.27571,
  title  = {Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum},
  author = {Zhuoning Guo and Mingxin Li and Yanzhao Zhang and Dingkun Long and Pengjun Xie and Xiaowen Chu},
  journal= {arXiv preprint arXiv:2510.27571},
  year   = {2025}
}