中文

大规模语义视频片段检索:一项新任务与一个基线方法

计算机视觉与模式识别 2022-10-18 v1

摘要

受以相关视频片段而非完整视频来节省搜索需求的日益增长所驱动,我们提出一项新任务,称为大规模语义视频片段检索(SVMR),旨在找到相关视频并重新定位其中的视频片段。我们的任务并非视频检索与视频重定位的简单组合,而是因若干本质方面而更具挑战性。在第一阶段,我们的SVMR需考虑以下事实:1)一个正候选长视频可包含大量同样具有语义意义的无关片段;2)若长视频包含与两个查询相关的片段,则该长视频可能对两个完全不同的查询片段均为正样本。第二重定位阶段也展现出与现有视频重定位任务不同的假设,后者假设参考视频必须包含与查询片段语义相似的对应段。相反,在我们的场景中,由于第一阶段的不准确性,检索到的长视频可能是假正样本。为应对这些挑战,我们提出两阶段基线方案:先检索候选视频,随后采用一种新颖的基于注意力的查询-参考语义对齐框架从候选视频中重定位目标片段。此外,我们基于现成的ActivityNet-1.3和HACS构建了两个更合适的基准数据集,以对SVMR模型进行全面评估。大量实验表明,我们的方案优于若干参考方案。

关键词

引用

@article{arxiv.2210.08389,
  title  = {Semantic Video Moments Retrieval at Scale: A New Task and a Baseline},
  author = {Na Li},
  journal= {arXiv preprint arXiv:2210.08389},
  year   = {2022}
}