TrackMAE:基于轨迹掩码与预测的视频表征学习方法
计算机视觉与模式识别
2026-03-31 v1
摘要
掩码视频建模(MVM)已成为一种简单且可扩展的自监督预训练范式,但仅以隐式方式编码运动信息,限制了对学习表征中时间动态的编码。因此,这类模型在需要细粒度运动感知能力的运动中心任务上表现不佳。为此,我们提出TrackMAE,这是一种简单易行的掩码视频建模范式,显式地将运动信息用作重建信号。在TrackMAE中,我们使用即插即用的点跟踪器对输入视频中的点进行稀疏跟踪,生成运动轨迹。此外,我们利用提取的轨迹改进随机管道掩码,采用运动感知掩码策略。通过提供以运动目标形式的补充监督信号,我们在像素和特征语义重建空间中增强了所学习的视频表征。我们在六个数据集上进行评估,覆盖多样的下游设置,发现TrackMAE consistently优于最新的视频自监督学习基线,学习出更具辨识度和可泛化性的表征。代码已公开https://github.com/rvandeghen/TrackMAE
引用
@article{arxiv.2603.27268,
title = {TrackMAE: Video Representation Learning via Track Mask and Predict},
author = {Renaud Vandeghen and Fida Mohammad Thoker and Marc Van Droogenbroeck and Bernard Ghanem},
journal= {arXiv preprint arXiv:2603.27268},
year = {2026}
}
备注
Accepted to CVPR 2026