中文

通过高效后预训练获取视频基础模型

计算机视觉与模式识别 2026-03-17 v2

摘要

由于视频数据的冗余性以及缺乏高质量视频-语言数据集,构建视频-语言基础模型成本高且困难。本文提出一种从图像基础模型高效获取视频基础模型的框架。我们的方法直观简单:在后预训练过程中随机丢弃输入视频块并掩码输入文本。块丢弃显著提升了训练效率,文本掩码则强化了跨模态融合的学习。我们进行了大量实验,在广泛的视频-语言下游任务上验证方法有效性,包括各类零样本任务、视频问答和视频-文本检索。尽管简单,我们的方法取得了最先进(state-of-the-art)性能,可与一些重度预训练的视频基础模型相媲美。我们的方法极高效,在 8 块 GPU 上不到一天即可完成训练,且仅需 WebVid-10M 作为预训练数据。我们希望该方法能作为主流视频基础模型的简洁而强大的对应方案,为构建此类模型提供有益见解,并提升大模型的可获取性与可持续性。本文为 InternVideo 项目的一部分 https://github.com/OpenGVLab/InternVideo。

关键词

引用

@article{arxiv.2310.19554,
  title  = {Harvest Video Foundation Models via Efficient Post-Pretraining},
  author = {Yizhuo Li and Kunchang Li and Yinan He and Yi Wang and Yali Wang and Limin Wang and Yu Qiao and Ping Luo},
  journal= {arXiv preprint arXiv:2310.19554},
  year   = {2026}
}