迈向长视频理解
计算机视觉与模式识别
2021-06-22 v1
摘要
我们的世界提供着永无止境的视觉刺激流,然而如今的视觉系统仅能在几秒内准确识别模式。这些系统理解当下,却无法将其置于过去或未来事件中语境化。本文研究长视频理解。我们引入一种对长视频建模的框架,并在大规模数据集上制定评估协议。我们表明,现有的SOTA短期模型在长视频任务上能力有限。一种新颖的以对象为中心的基于transformer的视频识别架构在7项多样任务上表现显著更优,并在AVA数据集上优于可比较的SOTA方法。
引用
@article{arxiv.2106.11310,
title = {Towards Long-Form Video Understanding},
author = {Chao-Yuan Wu and Philipp Krähenbühl},
journal= {arXiv preprint arXiv:2106.11310},
year = {2021}
}
备注
CVPR 2021