中文

面向事件感知的视频文本检索

量子物理 2024-07-11 v1

摘要

理解视频中发生事件的内容及其内在时序逻辑对于视频文本检索至关重要。然而,网络爬取的预训练数据常缺乏足够的事件信息,广泛采用的数据级跨模态对比学习也难以捕获详细且复杂的视频文本事件对齐。为此,我们从数据和模型两个层面进行改进。就数据而言,我们专注于通过提出的事件增强策略来补充缺失的具体事件内容和事件时序转换。基于事件增强数据,我们构建了一个新颖的事件感知视频文本检索模型,即EA-VTR,通过卓越的视频事件感知能力实现了强大的视频文本检索能力。EA-VTR能够同时高效地编码帧级和视频级视觉表征,实现对事件内容和复杂事件时序的详细跨模态对齐,从而增强对视频事件的全面理解。我们的方法不仅在多个数据集上显著超越现有方法,证明了在文本到视频检索和视频动作识别任务上的优势,同时在多事件视频文本检索和视频时刻检索任务上展现出卓越的事件内容感知能力,以及在时光测试任务上展现出突出的事件时序逻辑理解能力。

关键词

引用

@article{arxiv.2407.07477,
  title  = {Photonic Entanglement and Polarization Nonclassicality: Two Manifestations, One Nature},
  author = {Laura Ares and Nidhin Prasannan and Elizabeth Agudelo and Alfredo Luis and Benjamin Brecht and Christine Silberhorn and Jan Sperling},
  journal= {arXiv preprint arXiv:2407.07477},
  year   = {2024}
}