中文

OmniVid:通用视频理解的生成框架

计算机视觉与模式识别 2024-03-28 v1

摘要

视频理解任务(如识别、描述和跟踪)的核心是自动检测视频中的对象或动作并分析其时间演化。尽管共享相同的目标,但不同任务往往依赖于不同的模型架构和标注格式。相比之下,自然语言处理受益于统一的输出空间,即文本序列,这简化了以大量训练语料训练强大的基础语言模型(如 GPT-3)。受到启发,我们寻求通过使用语言作为标签并引入时间和框标记来统一视频理解任务的输出空间。如此一来,各种视频任务都可以作为基于视频的标记生成来实现。这使我们能够在完全共享的编码器-解码器架构中 following a generative framework 处理各种类型的视频任务,包括分类任务(如动作识别)、描述任务(涵盖剪辑描述、视频问答和密集视频描述)以及局化任务(如视觉对象跟踪)。通过大量实验,我们证明这一简单而直接的想法相当有效,可在七个视频基准上实现最先进或有竞争力的结果,为更通用的视频理解提供了新的视角。代码可在 https://github.com/wangjk666/OmniVid 获取。

关键词

引用

@article{arxiv.2403.17935,
  title  = {OmniVid: A Generative Framework for Universal Video Understanding},
  author = {Junke Wang and Dongdong Chen and Chong Luo and Bo He and Lu Yuan and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2403.17935},
  year   = {2024}
}

备注

Accepted by CVPR 2024