超越 16 帧的对比预训练视频优先编码器的简单方案
计算机视觉与模式识别
2024-12-31 v2 计算与语言
摘要
理解长篇真实世界视频需要建模长程视觉依赖关系。为此,我们探索了视频优先架构,建立在通过浅层时间融合将大规模图像-文本模型迁移到视频的常见范式之上。然而,我们揭示了该方法的两个局限性:(1) 空间能力下降,可能是由于标准视频数据集中糟糕的视频-语言对齐;(2) 更高的内存消耗,限制了可处理的帧数。为了缓解内存瓶颈,我们系统分析了各种高效方法的内存/精度权衡:分解注意力、参数高效的图像到视频自适应、输入掩码和多分辨率分块。令人惊讶的是,在对比预训练期间简单地掩码大部分视频(高达 75%)被证明是将编码器扩展到 1 FPS 下长达 4.3 分钟视频的最稳健方法之一。我们用于训练长视频到文本模型的简单方法可扩展至 1B 参数,不增加新的架构复杂性,并且在具有长程时间依赖关系的基准测试 (YouCook2, EgoSchema) 上,能够优于使用大得多的 LLM 作为基于片段信息聚合器的流行范式。
引用
@article{arxiv.2312.07395,
title = {A Simple Recipe for Contrastively Pre-training Video-First Encoders Beyond 16 Frames},
author = {Pinelopi Papalampidi and Skanda Koppula and Shreya Pathak and Justin Chiu and Joe Heyward and Viorica Patraucean and Jiajun Shen and Antoine Miech and Andrew Zisserman and Aida Nematzadeh},
journal= {arXiv preprint arXiv:2312.07395},
year = {2024}
}