点提示:基于视频扩散模型的反事实跟踪
计算机视觉与模式识别
2026-04-15 v2
摘要
跟踪器和视频生成器解决的是相邻的问题:前者分析运动,后者合成运动。我们展示,这一联系使得预训练的视频扩散模型能够通过简单地提示它们在时间上标记点来执行零样本点跟踪。我们在查询点处放置不同颜色的标记,然后从中间噪声水平重新生成其余视频。这会在帧之间传递标记,描绘出该点的轨迹。为确保即使在自然视频中不太可能出现的标记仍可见,我们使用未编辑的初始帧作为负面提示。在多个图像条件视频扩散模型的实验中,我们发现这些“涌现”轨迹优于先前的零样本方法,且在遮挡时仍能持续工作,常常达到专门自监督模型的性能。
引用
@article{arxiv.2510.11715,
title = {Point Prompting: Counterfactual Tracking with Video Diffusion Models},
author = {Ayush Shrivastava and Sanyam Mehta and Daniel Geng and Andrew Owens},
journal= {arXiv preprint arXiv:2510.11715},
year = {2026}
}
备注
ICLR 2026. Project link: https://point-prompting.github.io