中文

迈向长视频理解

计算机视觉与模式识别 2021-06-22 v1

摘要

我们的世界提供着永无止境的视觉刺激流,然而如今的视觉系统仅能在几秒内准确识别模式。这些系统理解当下,却无法将其置于过去或未来事件中语境化。本文研究长视频理解。我们引入一种对长视频建模的框架,并在大规模数据集上制定评估协议。我们表明,现有的SOTA短期模型在长视频任务上能力有限。一种新颖的以对象为中心的基于transformer的视频识别架构在7项多样任务上表现显著更优,并在AVA数据集上优于可比较的SOTA方法。

关键词

引用

@article{arxiv.2106.11310,
  title  = {Towards Long-Form Video Understanding},
  author = {Chao-Yuan Wu and Philipp Krähenbühl},
  journal= {arXiv preprint arXiv:2106.11310},
  year   = {2021}
}

备注

CVPR 2021