中文

视频理解的基础模型综述

计算机视觉与模式识别 2024-05-08 v1

摘要

视频基础模型(ViFMs)旨在学习用于各种视频理解任务的通用表示。通过利用大规模数据集和强大的模型,ViFMs通过捕获来自视频数据的鲁健且通用的特征来实现此目标。本综述分析了超过200个视频基础模型,提供了涵盖14个不同视频任务(分为3个主要类别)的基准和评估指标的全面概述。此外,我们对这些模型针对6个最常见视频任务进行了深入的性能分析。我们将ViFMs分为三个类别:1)基于图像的ViFMs,这些模型针对视频任务调整了现有的图像模型;2)基于视频的ViFMs,这些模型利用视频特定的编码方法;3)通用基础模型(UFMs),这些模型在单个框架中结合多种模态(图像、视频、音频和文本等)。通过比较各种ViFMs在不同任务上的性能,本综述为这些模型的优势和不足提供了有价值的见解,指导了未来在视频理解方面的发展。我们的分析意外地发现,基于图像的基础模型在大多数视频理解任务上 consistently 优于基于视频的模型。此外,利用多种模态的UFMs在视频任务上表现出优越性能。我们在:https://github.com/NeeluMadan/ViFM_Survey.git 分享了本文所研究的ViFMs的完整列表。

关键词

引用

@article{arxiv.2405.03770,
  title  = {Foundation Models for Video Understanding: A Survey},
  author = {Neelu Madan and Andreas Moegelmose and Rajat Modi and Yogesh S. Rawat and Thomas B. Moeslund},
  journal= {arXiv preprint arXiv:2405.03770},
  year   = {2024}
}