中文

TrackMAE:基于轨迹掩码与预测的视频表征学习方法

计算机视觉与模式识别 2026-03-31 v1

摘要

掩码视频建模(MVM)已成为一种简单且可扩展的自监督预训练范式,但仅以隐式方式编码运动信息,限制了对学习表征中时间动态的编码。因此,这类模型在需要细粒度运动感知能力的运动中心任务上表现不佳。为此,我们提出TrackMAE,这是一种简单易行的掩码视频建模范式,显式地将运动信息用作重建信号。在TrackMAE中,我们使用即插即用的点跟踪器对输入视频中的点进行稀疏跟踪,生成运动轨迹。此外,我们利用提取的轨迹改进随机管道掩码,采用运动感知掩码策略。通过提供以运动目标形式的补充监督信号,我们在像素和特征语义重建空间中增强了所学习的视频表征。我们在六个数据集上进行评估,覆盖多样的下游设置,发现TrackMAE consistently优于最新的视频自监督学习基线,学习出更具辨识度和可泛化性的表征。代码已公开https://github.com/rvandeghen/TrackMAE

关键词

引用

@article{arxiv.2603.27268,
  title  = {TrackMAE: Video Representation Learning via Track Mask and Predict},
  author = {Renaud Vandeghen and Fida Mohammad Thoker and Marc Van Droogenbroeck and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2603.27268},
  year   = {2026}
}

备注

Accepted to CVPR 2026