中文

面向深度视频理解的查询感知长视频定位与关系判别

计算机视觉与模式识别 2023-10-20 v1

摘要

视频与社交媒体内容的激增凸显了对多媒体数据更深理解的必要。现有多数成熟的视频理解技术在短格式及仅需浅层理解的内容上表现良好,但在需要深度理解与推理的长格式视频上表现不佳。深度视频理解(DVU)挑战赛旨在推进多模态提取、融合与分析的边界,以解决长视频整体分析并提取有用知识以回答不同类型查询的问题。本文引入一种利用图像-语言预训练模型的查询感知长视频定位与关系判别方法。该模型熟练地选择与查询相关的帧,免去了构建完整电影级知识图谱的需要。我们的方法在两组电影级查询上分别取得第一与第四名次。充分的实验与最终排名证明了其有效性与鲁棒性。

关键词

引用

@article{arxiv.2310.12724,
  title  = {Query-aware Long Video Localization and Relation Discrimination for Deep Video Understanding},
  author = {Yuanxing Xu and Yuting Wei and Bin Wu},
  journal= {arXiv preprint arXiv:2310.12724},
  year   = {2023}
}

备注

ACM MM 2023 Grand Challenge