中文

利用视频扩散先验实现稳健配准——面向点轨迹的去噪跟踪

计算机视觉与模式识别 2026-03-24 v2

摘要

本文介绍了HeFT(Head-Frequency Tracker),一个零样本点跟踪框架,利用预训练视频扩散模型的视觉先验。为更好地理解它们如何编码时空信息,我们分析了Video Diffusion Transformer(VDiT)的内部表示。我们的分析揭示注意力头作为最小功能单元,具有针对匹配、语义理解和位置编码的不同专化。此外,我们发现VDiT特征中的低频分量对于建立配准至关重要,而高频分量则倾向于引入噪声。基于这些洞见,我们提出了一种面向注意力头和频率的特征选择策略,联合选择最具信息量的注意力头和低频分量以提升跟踪性能。具体而言,我们的方法通过单步去噪提取判别特征,应用特征选择,然后利用软-Argmax定位和前向-后向一致性检查进行配准估计。在TAP-Vid基准测试上进行大量实验表明,HeFT实现了零样本跟踪的状态突破性能,接近监督方法的准确率,同时无需标注训练数据。我们的工作进一步凸显了视频扩散模型作为强大基础模型处理多种下游任务的前景,为通用视觉基础模型之路提供了可能性。

关键词

引用

@article{arxiv.2512.04619,
  title  = {Denoise to Track: Harnessing Video Diffusion Priors for Robust Correspondence},
  author = {Tianyu Yuan and Yuanbo Yang and Lin-Zhuo Chen and Yao Yao and Zhuzhong Qian},
  journal= {arXiv preprint arXiv:2512.04619},
  year   = {2026}
}