中文

SEVERE++:视频表征学习中基准测试灵敏度的评估

计算机视觉与模式识别 2025-04-09 v1

摘要

自监督学习的持续进展导致视频表征学习取得显著进展,这为消除对手动标注的需求提供了可扩展的替代方案。尽管在标准动作识别基准测试上表现出色,但视频自监督学习方法大多在狭窄的协议下进行评估,通常在 Kinetics-400 上预训练后在相似数据集上微调,限制了我们对其在现实世界情景下泛化能力的了解。本文全面评估了现代视频自监督模型,关注四个关键下游因素:域迁移、样本效率、动作细粒度和任务多样性。基于我们先前分析 CNN 基准灵敏度的工作,我们将研究扩展到覆盖最新基于 transformer 的视频-only 和视频文本模型。具体而言,我们对 12 个基于 transformer 的方法(7 个视频-only、5 个视频文本)进行基准测试,并与 10 个 CNN 方法进行比较,总计进行了超过 1100 项实验,涵盖 8 个数据集和 7 个下游任务。我们的分析显示,尽管在架构方面取得了进展,基于 transformer 的模型仍然对下游条件敏感。没有任何方法在所有因素上都能一致泛化,视频-only transformer 在域迁移下表现更好,CNN 在细粒度任务中占优势,视频文本模型尽管大规模预训练常常表现不佳。我们还发现最近的 transformer 模型并不一致地超越了早期方法。我们的发现为当前视频 SSL 方法的优势和局限性提供了详细视图,并为评估视频表征学习中的泛化提供了统一的基准。

关键词

引用

@article{arxiv.2504.05706,
  title  = {SEVERE++: Evaluating Benchmark Sensitivity in Generalization of Video Representation Learning},
  author = {Fida Mohammad Thoker and Letian Jiang and Chen Zhao and Piyush Bagad and Hazel Doughty and Bernard Ghanem and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:2504.05706},
  year   = {2025}
}

备注

Under Review