中文

LV-MAE:通过掩码嵌入自编码器学习长视频表示

计算机视觉与模式识别 2025-10-08 v2

摘要

在这项工作中,我们引入了长视频掩码嵌入自编码器(LV-MAE),一种用于长视频表示的自监督学习框架。我们的方法将短程和长程依赖视为两个独立的任务。这种解耦允许更直观的视频处理,其中首先编码短程时空基元,然后用于捕获连续视频片段之间的长程依赖。为实现这一点,我们利用先进的多模态编码器从长视频中的短片段提取表示,随后预训练一个掩码嵌入自编码器,以捕获片段间的高层交互。LV-MAE训练效率高,并通过缓解输入帧数量的约束,能够处理更长的视频。此外,与通常在短视频数据集上预训练的现有方法不同,我们的方法能够大规模使用长视频样本(例如20分钟以上的视频片段)进行自监督预训练。使用LV-MAE表示,我们在三个长视频基准——LVU、COIN和Breakfast——上取得了最先进的结果,仅使用简单的分类头进行注意力或线性探测。最后,为了评估LV-MAE预训练并可视化其重建质量,我们利用短视频表示的视频-语言对齐空间,通过视频-文本检索来监控LV-MAE。代码可在https://github.com/amazon-science/lv-mae获取。

关键词

引用

@article{arxiv.2504.03501,
  title  = {LV-MAE: Learning Long Video Representations through Masked-Embedding Autoencoders},
  author = {Ilan Naiman and Emanuel Ben-Baruch and Oron Anschel and Alon Shoshan and Igor Kviatkovsky and Manoj Aggarwal and Gerard Medioni},
  journal= {arXiv preprint arXiv:2504.03501},
  year   = {2025}
}

备注

Accepted to the International Conference on Computer Vision, ICCV 2025