中文

MINOTAUR:基于多模态查询的多任务视频定位

计算机视觉与模式识别 2023-03-21 v2

摘要

视频理解任务形式多样,从动作检测到视觉查询定位,再到句子的时空定位。这些任务在输入类型(仅视频,或视频-查询对,其中查询为图像区域或句子)与输出(时间片段或时空管)上有所不同。然而,其核心均要求对视频的相同基本理解,即其中参与者与物体、其动作及交互。迄今为止,这些任务被孤立地以各自高度专用的架构处理,未利用任务间相互作用。相反,本文提出一种单一统一模型,用于处理长视频中基于查询的视频理解。具体而言,我们的模型可解决Ego4D情景记忆基准的全部三项任务,其涉及三种不同形式的查询:给定第一人称视频及视觉、文本或活动查询,目标为确定视频中何时及何处可见答案。我们的模型设计受近期基于查询的时空定位方法启发,包含模态特定查询编码器与任务特定滑动窗口推理,从而允许以多样输入模态与不同结构化输出进行多任务训练。我们详尽分析了任务间关系,并表明跨任务学习可提升各单独任务性能,以及泛化至未见任务的能力,例如语言查询的零样本空间定位。

关键词

引用

@article{arxiv.2302.08063,
  title  = {MINOTAUR: Multi-task Video Grounding From Multimodal Queries},
  author = {Raghav Goyal and Effrosyni Mavroudi and Xitong Yang and Sainbayar Sukhbaatar and Leonid Sigal and Matt Feiszli and Lorenzo Torresani and Du Tran},
  journal= {arXiv preprint arXiv:2302.08063},
  year   = {2023}
}

备注

22 pages, 8 figures and 13 tables