中文

CrossVideoMAE:基于掩码自编码器的自监督图像-视频表征学习

计算机视觉与模式识别 2025-02-13 v1

摘要

当前的视频-based掩码自编码器(MAE)主要关注从视觉角度学习有效的时空表征,这可能导致模型优先考虑一般时空模式,却常常忽略诸如特定互动或序列等细微语义属性——例如与人类认知中空间时间对应性更贴合的行动特定特征。这会限制模型捕捉特定情境丰富且连续行为本质的能力。人类能够将静态实例中可用的视觉概念、对象视图不变性和语义属性映射到自然动态场景或视频的理解中。现有的视频和静态图像MAE依赖于独立的视频和图像数据集,这可能缺乏足以完全理解所学概念的丰富语义属性,尤其是与使用视频及其对应抽样帧图像相比较时。为此,我们提出CrossVideoMAE,这是一种端到端的自监督跨模态对比学习MAE,有效学习视频级别和帧级别的丰富时空表征和语义属性。该方法将视频中相互的时空信息与从抽样帧中获得的时空信息整合到特征不变空间,同时鼓励视频领域内部的增强不变性。通过在可见标记和特征对应性方面进行联合嵌入,实现跨模态和内部模态之间的特征对应,这对于在自监督方式下从视频和帧图像模态中获取丰富、无标签的引导信号至关重要。大量实验表明,我们的方法优于以往的SOTA方法,消融实验验证了方法有效性。

关键词

引用

@article{arxiv.2502.07811,
  title  = {CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders},
  author = {Shihab Aaqil Ahamed and Malitha Gunawardhana and Liel David and Michael Sidorov and Daniel Harari and Muhammad Haris Khan},
  journal= {arXiv preprint arXiv:2502.07811},
  year   = {2025}
}