通过预测三维高斯分布进行跟踪
计算机视觉与模式识别
2026-01-01 v2
摘要
我们提出了 Video Gaussian Masked Autoencoders (Video-GMAE),这是一种用于表示学习的自监督方法,通过一组在时间上移动的高斯点编码图像序列。将视频表示为一组高斯点强制执行一种合理的归纳偏置:二维视频通常是动态三维场景的一致投影。我们发现,当采用这种体系结构对网络进行预训练时,跟踪功能会自然涌现。将所学习高斯点的轨迹映射到图像平面后,可获得与最先进方法相当的零样本跟踪性能。经过小规模微调,模型在 Kinetics 数据集上提升 34.6%,在 Kubric 数据集上提升 13.1%,超越了现有的自监督视频方法。项目页面和代码均可公开访问:https://videogmae.org/ 和 https://github.com/tekotan/video-gmae。
引用
@article{arxiv.2512.22489,
title = {Tracking by Predicting 3-D Gaussians Over Time},
author = {Tanish Baranwal and Himanshu Gaurav Singh and Jathushan Rajasegaran and Jitendra Malik},
journal= {arXiv preprint arXiv:2512.22489},
year = {2026}
}