将视频掩码自编码器扩展到128帧
计算机视觉与模式识别
2024-11-22 v1
摘要
视频理解取得了显著进展,最近的视频基础模型由于自监督预训练目标(掩码自编码器是首选设计)而展现出强大性能。然而,先前大多数利用掩码自编码器预训练的工作都集中在相对较短的视频表示(16/32帧长度)上,这主要是由于硬件内存和计算限制,因为密集内存消耗的自注意力解码会随着视频长度增加而扩展性变差。解决这些挑战的一种自然策略是在解码过程中对令牌进行子采样以进行重建(即解码器掩码)。在这项工作中,我们提出了一种有效的令牌优先级策略,该策略允许在更长的视频序列(128帧)上进行训练,并且性能优于更典型的随机和均匀掩码策略。我们方法的核心是一种自适应解码器掩码策略,该策略优先考虑最重要的令牌,并使用量化令牌作为重建目标。我们的自适应策略利用了一个强大的基于MAGVIT的分词器,该分词器联合学习令牌及其优先级。我们通过详尽的消融实验验证了我们的设计选择,并观察到所得长视频(128帧)编码器相对于短视频(32帧)编码器的性能提升。通过我们的长视频掩码自编码器策略,我们在Diving48上超越了最先进水平3.9个百分点,在EPIC-Kitchens-100动词分类上超越了2.5个百分点,同时依赖于简单的核心架构和仅视频预训练(与一些需要数百万标注视频-文本对或专用编码器的先前工作不同)。
引用
@article{arxiv.2411.13683,
title = {Extending Video Masked Autoencoders to 128 frames},
author = {Nitesh Bharadwaj Gundavarapu and Luke Friedman and Raghav Goyal and Chaitra Hegde and Eirikur Agustsson and Sagar M. Waghmare and Mikhail Sirotenko and Ming-Hsuan Yang and Tobias Weyand and Boqing Gong and Leonid Sigal},
journal= {arXiv preprint arXiv:2411.13683},
year = {2024}
}
备注
10.5 pages of main paper, 25 pages total, 4 figures and 10 tables. To appear in NeurIPS'24