中文

为基于片段的视频关系检测辩护

计算机视觉与模式识别 2023-07-19 v1

摘要

视频视觉关系检测(VidVRD)旨在利用空间边界框和时间边界在视频中检测视觉关系三元组。现有的 VidVRD 方法根据其关系分类方式可大致分为自底向上和自顶向下两种范式。自底向上方法遵循基于片段(clip)的方式,对短片段管对(tubelet pair)的关系进行分类,然后将其合并为长视频关系。另一方面,自顶向下方法直接对长视频管对进行分类。尽管近期利用视频管(video tubelet)的视频方法已展现出有前景的结果,我们认为空间与时间上下文的有效建模比选择片段管还是视频管更为关键。这促使我们重新审视基于片段的范式,并探索 VidVRD 中的关键成功因素。本文提出一种分层上下文模型(HCM),基于片段丰富基于对象的空间上下文与基于关系的时间上下文。我们证明使用片段管可比大多数基于视频的方法取得更优性能。此外,使用片段管在模型设计上更具灵活性,并有助于缓解与视频管相关的局限,例如困难的长时对象跟踪问题以及长时管特征压缩中的时间信息丢失。在两个具挑战性的 VidVRD 基准上进行的广泛实验验证了我们的 HCM 取得了新的最先进(state-of-the-art)性能,凸显了在基于片段的范式中引入先进空间与时间上下文建模的有效性。

关键词

引用

@article{arxiv.2307.08984,
  title  = {In Defense of Clip-based Video Relation Detection},
  author = {Meng Wei and Long Chen and Wei Ji and Xiaoyu Yue and Roger Zimmermann},
  journal= {arXiv preprint arXiv:2307.08984},
  year   = {2023}
}