中文

通过预测三维高斯分布进行跟踪

计算机视觉与模式识别 2026-01-01 v2

摘要

我们提出了 Video Gaussian Masked Autoencoders (Video-GMAE),这是一种用于表示学习的自监督方法,通过一组在时间上移动的高斯点编码图像序列。将视频表示为一组高斯点强制执行一种合理的归纳偏置:二维视频通常是动态三维场景的一致投影。我们发现,当采用这种体系结构对网络进行预训练时,跟踪功能会自然涌现。将所学习高斯点的轨迹映射到图像平面后,可获得与最先进方法相当的零样本跟踪性能。经过小规模微调,模型在 Kinetics 数据集上提升 34.6%,在 Kubric 数据集上提升 13.1%,超越了现有的自监督视频方法。项目页面和代码均可公开访问:https://videogmae.org/ 和 https://github.com/tekotan/video-gmae。

关键词

引用

@article{arxiv.2512.22489,
  title  = {Tracking by Predicting 3-D Gaussians Over Time},
  author = {Tanish Baranwal and Himanshu Gaurav Singh and Jathushan Rajasegaran and Jitendra Malik},
  journal= {arXiv preprint arXiv:2512.22489},
  year   = {2026}
}