中文

EA-VTR:事件感知的视频-文本检索

计算机视觉与模式识别 2024-07-11 v1

摘要

理解视频中发生事件的内容及其内在时间逻辑对于视频-文本检索至关重要。然而,网络爬取的预训练数据集通常缺乏充分的事件信息,且广泛采用的视频级跨模态对比学习也难以捕捉详细且复杂的视频-文本事件对齐。为了应对这些挑战,我们从数据和模型两个角度进行了改进。在预训练数据方面,我们通过提出的事件增强策略,着重补充缺失的特定事件内容和事件时序转换。基于事件增强数据,我们构建了一个新颖的事件感知视频-文本检索模型,即 EA-VTR,它通过卓越的视频事件感知能力实现了强大的视频-文本检索能力。EA-VTR 能够同时高效地编码帧级和视频级视觉表征,实现详细的事件内容和复杂的事件时序跨模态对齐,最终增强对视频事件的全面理解。我们的方法不仅在多个数据集上的文本到视频检索和视频动作识别任务中显著优于现有方法,而且在多事件视频-文本检索和视频时刻检索任务中展现出更优的事件内容感知能力,并在时间测试任务中展现出出色的时序逻辑理解能力。

关键词

引用

@article{arxiv.2407.07478,
  title  = {EA-VTR: Event-Aware Video-Text Retrieval},
  author = {Zongyang Ma and Ziqi Zhang and Yuxin Chen and Zhongang Qi and Chunfeng Yuan and Bing Li and Yingmin Luo and Xu Li and Xiaojuan Qi and Ying Shan and Weiming Hu},
  journal= {arXiv preprint arXiv:2407.07478},
  year   = {2024}
}

备注

Accepted by ECCV 2024