中文

VideoGLUE:基础模型视频通用理解评测

计算机视觉与模式识别 2024-10-28 v3

摘要

我们使用精心设计的实验协议评估现有基础模型(FMs)的视频理解能力,该协议由三项标志性任务(动作识别、时间定位与时空定位)、社区广泛使用的八个数据集,以及为下游任务定制 FM 的四种适配方法组成。此外,我们利用训练和推理过程中的代价度量,联合刻画 FM 在适配通用视频理解任务时的效能与效率。我们的主要发现如下。第一,与 FM 在自然语言和图像理解中所取得的成就形成鲜明对比,任务专用模型显著优于本工作中研究的七个 FM。第二,预训练数据主要包含视频模态的视频原生 FM,在分类富含运动的视频、在时间上定位动作以及理解包含多个动作的视频方面,通常优于图像原生 FM。第三,视频原生 FM 在轻量适配下游任务(例如冻结 FM 主干)下即可在视频任务上表现良好,而图像原生 FM 在完全端到端微调中胜出。前两点观察揭示了开展以视频为中心的 FM 研究的必要性与巨大机遇,最后一点则确认在 FM 评测中任务与适配方法均至关重要。我们的代码发布于:https://github.com/tensorflow/models/tree/master/official/projects/videoglue。

关键词

引用

@article{arxiv.2307.03166,
  title  = {VideoGLUE: Video General Understanding Evaluation of Foundation Models},
  author = {Liangzhe Yuan and Nitesh Bharadwaj Gundavarapu and Long Zhao and Hao Zhou and Yin Cui and Lu Jiang and Xuan Yang and Menglin Jia and Tobias Weyand and Luke Friedman and Mikhail Sirotenko and Huisheng Wang and Florian Schroff and Hartwig Adam and Ming-Hsuan Yang and Ting Liu and Boqing Gong},
  journal= {arXiv preprint arXiv:2307.03166},
  year   = {2024}
}

备注

Accepted to TMLR