大规模整体视频理解
计算机视觉与模式识别
2020-12-16 v3
摘要
近年来,借助具有丰富标注的基准,视频识别取得了进展。然而,研究仍主要局限于人体动作或体育动作识别——聚焦于高度特定的视频理解任务,从而在描述视频整体内容方面留下了显著差距。我们通过提出大规模“整体视频理解数据集”(HVU)来弥补这一差距。HVU 以语义分类法按层次组织,关注多标签与多任务视频理解这一综合问题,涵盖动态场景中多个语义方面的识别。HVU 总共包含约 57.2 万段视频,在训练、验证和测试集上有 900 万条标注,覆盖 3142 个标签。HVU 包含基于场景、物体、动作、事件、属性和概念类别所定义的语义方面,自然捕捉了真实世界场景。我们在三项具有挑战性的任务上展示了 HVU 的泛化能力:1.) 视频分类,2.) 视频描述生成,3.) 视频聚类任务。特别是在视频分类中,我们引入了一种称为“整体表观与时序网络”(HATNet)的新的时空深度神经网络架构,其通过将 2D 与 3D 架构融合为一,结合表观与时序线索的中间表示。HATNet 关注多标签与多任务学习问题,并以端到端方式训练。通过实验,我们验证了整体表示学习具有互补性、且能在赋能诸多现实应用中发挥关键作用的观点。
引用
@article{arxiv.1904.11451,
title = {Large Scale Holistic Video Understanding},
author = {Ali Diba and Mohsen Fayyaz and Vivek Sharma and Manohar Paluri and Jurgen Gall and Rainer Stiefelhagen and Luc Van Gool},
journal= {arXiv preprint arXiv:1904.11451},
year = {2020}
}
备注
ECCV 2020