面向未见新颖语义视频时刻检索的生成式视频扩散
计算机视觉与模式识别
2025-02-24 v3
摘要
视频时刻检索(VMR)旨在未剪辑视频中定位与文本查询相对应的最可能视频时刻。现有方法的训练受限于缺乏多样且具泛化能力的 VMR 数据集,这阻碍了其将时刻-文本关联泛化至包含新颖语义概念(在训练源域中视觉和文本均未见)的查询的能力。为了使模型泛化至新颖语义,现有方法严重依赖于假设:除了源域成对训练数据外,还能访问目标域的视频和文本句子对。这既不实用也不可扩展。在本工作中,我们引入了一种更具泛化能力的方法,假设在模型训练时仅有描述新语义的文本句子可用,而无需见过目标域的任何视频。为此,我们提出了一种细粒度视频编辑框架,称为 FVE,该框架探索生成式视频扩散,以促进从已见源概念到包含新概念的未见目标句子的细粒度视频编辑。这使得能够生成目标域中对应于新概念的未见视频时刻的生成式假设。这种细粒度生成式视频扩散保留了源域的原始视频结构和主体细节,同时在目标域中引入了未见新词汇的语义区分。一个关键挑战在于,如何使这种生成式细粒度扩散过程在优化 VMR 时具有意义,而不仅仅是合成视觉上令人愉悦的视频。我们通过引入一种混合选择机制来解决这一问题,该机制整合了三个定量指标,以选择性地将合成视频时刻(新视频假设)作为原始源训练数据的扩充补充纳入其中,同时最小化潜在……
引用
@article{arxiv.2401.13329,
title = {Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval},
author = {Dezhao Luo and Shaogang Gong and Jiabo Huang and Hailin Jin and Yang Liu},
journal= {arXiv preprint arXiv:2401.13329},
year = {2025}
}
备注
AAAI-25