中文

事件感知视频语料库时刻检索

计算机视觉与模式识别 2024-02-22 v1 信息检索

摘要

视频语料库时刻检索 (VCMR) 是一项实用的视频检索任务,旨在利用自然语言查询在未剪辑视频的大型语料库中识别特定时刻。现有的 VCMR 方法通常依赖于帧感知视频检索,通过计算查询与视频帧之间的相似度,基于最大帧相似度对视频进行排名。然而,这种方法忽略了帧间信息中嵌入的语义结构,即事件,这是人类理解视频的关键要素。受此启发,我们提出了 EventFormer,这是一种明确利用视频中的事件作为视频检索基本单元的模型。该模型通过事件推理和分层事件编码提取事件表示。事件推理模块将连续且视觉上相似的帧表示分组为事件,而分层事件编码则在帧和事件两个层面编码信息。我们还引入了锚点多头自注意力机制,以促使 Transformer 捕捉视频中相邻内容的相关性。EventFormer 的训练通过双分支对比学习和针对 VCMR 两个子任务的双重优化进行。在 TVR、ANetCaps 和 DiDeMo 基准上的大量实验显示了 EventFormer 在 VCMR 中的有效性和效率,取得了新的最先进 (SOTA) 结果。此外,EventFormer 的有效性也在部分相关视频检索任务中得到了验证。

关键词

引用

@article{arxiv.2402.13566,
  title  = {Event-aware Video Corpus Moment Retrieval},
  author = {Danyang Hou and Liang Pang and Huawei Shen and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2402.13566},
  year   = {2024}
}

备注

11 pages, 5 figures, 9 tables