EVEREST:通过去除冗余时空令牌的高效掩码视频自编码器
计算机视觉与模式识别
2024-06-21 v6 机器学习
摘要
掩码视频自编码器(MVA)方法已展现出其潜力,显著优于先前的视频表示学习方法。然而,由于随机掩码策略,它们在预测无信息量的令牌/帧时浪费了过量的计算与内存(例如,超过 16 个节点配备 128 块 NVIDIA A100 GPU)。为解决此问题,我们利用视频中图像块间不均匀的信息密度,提出 EVEREST——一种令人惊讶地高效的 MVA 视频表示学习方法,该方法在预训练与微调期间寻找包含丰富运动特征的令牌并丢弃无信息的令牌。我们进一步提出信息密集帧选择策略,使模型能以最小冗余聚焦于有信息量且具因果性的帧。我们的方法显著降低了 MVA 的计算与内存需求,使得在单机 8 块 GPU 上即可完成预训练与微调,同时在多个基准及未筛选的 Ego4D 数据集上取得与计算与内存密集型基线相当的性能。我们希望我们的工作有助于降低视频理解进一步研究的门槛。
引用
@article{arxiv.2211.10636,
title = {EVEREST: Efficient Masked Video Autoencoder by Removing Redundant Spatiotemporal Tokens},
author = {Sunil Hwang and Jaehong Yoon and Youngwan Lee and Sung Ju Hwang},
journal= {arXiv preprint arXiv:2211.10636},
year = {2024}
}
备注
Accepted by ICML 2024