中文

TWLV-I:视频基础模型整体评估的分析与洞见

计算机视觉与模式识别 2024-08-26 v2

摘要

在这项工作中,我们讨论了以公平和稳健的方式评估视频基础模型。与语言或图像基础模型不同,许多视频基础模型使用不同的参数(如采样率、帧数、预训练步数等)进行评估,使得公平和稳健的比较具有挑战性。因此,我们提出了一种精心设计的评估框架,用于测量视频理解的两个核心能力:外观理解和运动理解。我们的发现揭示,现有视频基础模型,无论是像UMT或InternVideo2这样的文本监督模型,还是像V-JEPA这样的自监督模型,在这些能力中至少一个方面存在局限性。作为替代方案,我们提出了TWLV-I,一个新的视频基础模型,为基于运动和基于外观的视频构建鲁棒的视觉表示。基于五个动作识别基准上线性探测的平均top-1准确率(仅在公开可访问数据集上预训练),我们的模型相比V-JEPA(ViT-L)实现了4.6个百分点的提升,相比UMT(ViT-L)实现了7.7个百分点的提升。即使与更大的模型相比,我们的模型相比DFN(ViT-H)实现了7.2个百分点的提升,相比V-JEPA(ViT-H)实现了2.7个百分点的提升,相比InternVideo2(ViT-g)实现了2.8个百分点的提升。我们提供了TWLV-I从几个常用视频基准的视频中获得的嵌入向量,以及可以直接利用这些嵌入的评估源代码。代码可在 https://github.com/twelvelabs-io/video-embeddings-evaluation-framework 获取。

关键词

引用

@article{arxiv.2408.11318,
  title  = {TWLV-I: Analysis and Insights from Holistic Evaluation on Video Foundation Models},
  author = {Hyeongmin Lee and Jin-Young Kim and Kyungjune Baek and Jihwan Kim and Hyojun Go and Seongsu Ha and Seokjin Han and Jiho Jang and Raehyuk Jung and Daewoo Kim and GeunOh Kim and JongMok Kim and Jongseok Kim and Junwan Kim and Soonwoo Kwon and Jangwon Lee and Seungjoon Park and Minjoon Seo and Jay Suh and Jaehyuk Yi and Aiden Lee},
  journal= {arXiv preprint arXiv:2408.11318},
  year   = {2024}
}

备注

17 pages; Twelve Labs Technical Report