中文

基于并行回归的端到端密集视频定位

计算机视觉与模式识别 2024-02-29 v5

摘要

视频定位旨在根据语言查询在未修剪视频中定位相应的视频片段。现有方法通常通过将其转化为提议-匹配或融合-检测问题来间接处理该任务。解决这些替代问题通常需要在训练期间进行复杂的标签分配,并手动去除近似重复的结果。同时,现有工作通常关注以单个句子作为输入的稀疏视频定位,这可能由于描述不明确而导致定位模糊。本文研究了一个新的密集视频定位问题,即以段落作为输入同时定位多个片段。从视频定位作为语言条件回归的角度出发,我们通过重新利用类似Transformer的架构(PRVG)提出了一种端到端的并行解码范式。PRVG的关键设计是使用语言作为查询,并基于语言调制的视觉表示直接回归片段边界。由于其设计简单,PRVG框架可应用于不同的测试方案(稀疏或密集定位),并且无需任何后处理技术即可实现高效推理。此外,我们设计了一种鲁棒的提议级注意力损失来指导PRVG的训练,该损失对片段持续时间具有不变性,有助于模型收敛。我们在ActivityNet Captions和TACoS两个视频定位基准上进行了实验,结果表明我们的PRVG可以显著优于先前的方法。我们还进行了深入研究,以探讨并行回归范式在视频定位中的有效性。

关键词

引用

@article{arxiv.2109.11265,
  title  = {End-to-End Dense Video Grounding via Parallel Regression},
  author = {Fengyuan Shi and Weilin Huang and Limin Wang},
  journal= {arXiv preprint arXiv:2109.11265},
  year   = {2024}
}

备注

Accepted by Computer Vision and Image Understanding (CVIU) in February 2024