中文

一个具有阅读理解能力的大规模跨模态视频检索数据集

计算机视觉与模式识别 2023-05-08 v1

摘要

大多数现有的跨模态语言到视频检索(VR)研究仅关注来自视频的单模态输入,即视觉表征,而文本在人类环境中无处不在且对理解视频常常至关重要。为研究如何利用两种模态输入(即视觉与文本语义表征)检索视频,我们首先引入一个大规模、跨模态的带有文本阅读理解的视频检索数据集 TextVR,其包含来自 8 个场景领域(即街景(室内)、街景(室外)、游戏、体育、驾驶、活动、电视节目和烹饪)的 10.5k 个视频的 42.2k 条句子查询。所提出的 TextVR 需要一个统一的跨模态模型来识别并理解文本,将其与视觉上下文相关联,并判断哪些文本语义信息对视频检索任务至关重要。此外,我们给出了 TextVR 与现有数据集的详细对比分析,并为基于文本的 video retrieval 任务设计了一个新的多模态视频检索基线。数据集分析与大量实验表明,我们的 TextVR 基准为视频与语言社区提供了相比以往数据集的诸多新技术挑战与见解。项目网站与 GitHub 仓库分别位于 https://sites.google.com/view/loveucvpr23/guest-track 和 https://github.com/callsys/TextVR。

关键词

引用

@article{arxiv.2305.03347,
  title  = {A Large Cross-Modal Video Retrieval Dataset with Reading Comprehension},
  author = {Weijia Wu and Yuzhong Zhao and Zhuang Li and Jiahong Li and Hong Zhou and Mike Zheng Shou and Xiang Bai},
  journal= {arXiv preprint arXiv:2305.03347},
  year   = {2023}
}