中文

GEB+:面向通用事件边界描述、定位与检索的基准

计算机视觉与模式识别 2025-02-04 v5

摘要

认知科学表明,人类以由主导主体的状态变化所分隔的事件来感知视频。状态变化触发新事件,并且在所感知的大量冗余信息中是最有用的信息之一。然而,以往研究侧重于对视频片段的整体理解,而未评估其内部细粒度的状态变化。本文引入一个名为 Kinetic-GEB+ 的新数据集。该数据集包含超过 17 万条边界,并配有描述 12K 视频中通用事件状态变化的描述文本。基于这一新数据集,我们提出了三项任务,以支持通过状态变化实现对视频更细粒度、更鲁棒且更类人的理解。我们在该数据集上评估了许多代表性基线方法,其中我们还设计了一种新的 TPD(基于时间的成对差异,Temporal-based Pairwise Difference)建模方法来刻画视觉差异,并取得了显著的性能提升。此外,结果表明当前方法在利用不同粒度、视觉差异表征以及状态变化准确定位方面仍存在巨大挑战。进一步分析表明,我们的数据集能够推动开发更强大的方法来理解状态变化,从而提升视频级理解能力。包含视频与边界的数据集可在 https://yuxuan-w.github.io/GEB-plus/ 获取。

关键词

引用

@article{arxiv.2204.00486,
  title  = {GEB+: A Benchmark for Generic Event Boundary Captioning, Grounding and Retrieval},
  author = {Yuxuan Wang and Difei Gao and Licheng Yu and Stan Weixian Lei and Matt Feiszli and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2204.00486},
  year   = {2025}
}

备注

Updated in Jan. 2025, In Proceedings of the European Conference on Computer Vision 2022 [ECCV 2022], 27 pages