中文

基于多模态线索的多视频时刻排序

计算机视觉与模式识别 2023-02-01 v1

摘要

视频语料库时刻检索~(VCMR) 是通过自然语言查询从大规模未裁剪视频语料库中检索相关视频时刻的任务。VCMR 的当前最优工作基于两阶段方法。本文致力于改进两阶段方法的两个问题:(1) 时刻预测偏差:大多数查询的预测时刻来自检索排名靠前的视频,忽略了目标时刻位于检索排名靠后视频中的可能性,这由训练与推理时共享归一化(Shared Normalization)的不一致所导致。(2) 潜在关键内容:视频的不同模态对时刻定位具有不同的关键信息。为此,我们提出一个两阶段模型 \textbf{M}ult\textbf{I}-video ra\textbf{N}king with m\textbf{U}l\textbf{T}imodal clu\textbf{E}~(MINUTE)。MINUTE 在训练与推理时均使用共享归一化来对来自多个视频的候选时刻排序,以解决时刻预测偏差,使其预测目标时刻更高效。此外,MINUTE 的多模态线索挖掘~(MCM) 能发现视频中不同模态的关键内容,从而更精确地定位时刻。MINUTE 在 TVR 和 DiDeMo 数据集上优于基线,取得了 VCMR 的新最优结果。我们的代码将于 GitHub 上提供。

关键词

引用

@article{arxiv.2301.13606,
  title  = {Multi-video Moment Ranking with Multimodal Clue},
  author = {Danyang Hou and Liang Pang and Yanyan Lan and Huawei Shen and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2301.13606},
  year   = {2023}
}

备注

9 pages,6 figures