中文

面向基础模型时代的在线长期点跟踪

计算机视觉与模式识别 2025-07-15 v1

摘要

点跟踪旨在识别视频帧中相同的物理点,作为运动的几何感知表示。该表示支持从机器人到增强现实等广泛的应用, 通过实现对动态环境的精确建模。大多数现有的长期跟踪方法 operate in an offline setting(离线环境),即未来帧可用以细化预测并恢复遮挡。然而,现实场景往往要求在线预测:模型必须因果式运行,仅使用当前和过去的帧。这种约束在流式视频和具身 AI 中至关重要,在这些场景中,决策必须基于过去的观察立即做出。 在此约束下,viewpoint invariance(视点不变性)变得至关重要。视觉基础模型 trained on diverse large-scale datasets(在多样化的大规模数据集上训练)的视觉模型, 为鲁棒的几何表示提供了潜力。虽然它们本身缺乏时序推理,但可以集成到跟踪管道中以丰富空间特征。在本论文中,我们在在线设置下解决长期点跟踪问题,即没有访问未来信息或滑动窗口的情况下依次处理帧。我们首先评估视觉基础模型适用于此任务的可能性,发现它们可作为有用的初始化并可集成到跟踪管道中。然而,为实现在线设置下的长期跟踪,仍需专门设计。在 particular,maintaining coherence over time(维持时间一致性)在此因果环境中需要 memory(记忆)来跨帧传递外观和 context(上下文)。为此,我们提出Track-On,一种基于 transformer 的模型,将每个被跟踪点视为 query(查询),逐帧处理视频帧。Track-On 在七个公开基准测试中设定了新的 state of the art(最先进状态),表明在没有未来访问的情况下实现长期跟踪是可行的。

关键词

引用

@article{arxiv.2507.09217,
  title  = {Online Long-term Point Tracking in the Foundation Model Era},
  author = {Görkay Aydemir},
  journal= {arXiv preprint arXiv:2507.09217},
  year   = {2025}
}

备注

arXiv admin note: substantial text overlap with arXiv:2501.18487