面向通用视频检索:通过合成多模态金字塔课程泛化视频嵌入
计算机视觉与模式识别
2025-11-03 v1 人工智能
计算与语言
信息检索
机器学习
摘要
当前视频检索范式结构性地与限制性基准不匹配,因为狭窄的基准激励相应的有限数据和单任务训练。因此,由于缺乏定义和要求多维度泛化的诊断评估,通用能力被压制。为打破这一循环,我们提出一个以评估、数据和建模协同设计为基础的框架。首先,我们建立了通用视频检索基准(UVRB),由16个数据集组成,不仅用于衡量性能,还用于诊断跨任务和跨域的关键能力缺口。其次,依据UVRB的诊断,我们引入可扩展的合成工作流程,生成155万对高质量数据,以填充实现通用性所需的语义空间。最后,我们构思了“模态金字塔”课程,通过显式利用我们多样化数据中的潜在相互关联性,对我们的通用视频嵌入器(GVE)进行训练。大量实验表明,GVE在UVRB上实现了零样本泛化的状态最佳成绩。特别是,我们的分析揭示,流行的基准是poor predictors of general ability(一般能力的差劲预测器),且部分相关检索是被忽视且占主导的场景。总体而言,我们的协同设计框架为摆脱有限范围、迈向真正通用视频检索提供了实用路径。
引用
@article{arxiv.2510.27571,
title = {Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum},
author = {Zhuoning Guo and Mingxin Li and Yanzhao Zhang and Dingkun Long and Pengjun Xie and Xiaowen Chu},
journal= {arXiv preprint arXiv:2510.27571},
year = {2025}
}