TAPNext:将跟踪任意点(TAP)作为下一词预测
计算机视觉与模式识别
2025-04-15 v2
摘要
在视频中跟踪任意点(TAP)是一个具有许多应用于机器人、视频编辑和3D重建中的计算机视觉挑战任务。现有方法的TAP依赖于复杂的跟踪特定归纳偏置和启发式方法,这限制了其普适性和规模潜力。为应对这些挑战,我们提出TAPNext,这是一种将TAP建模为顺序掩码词解码的新方法。我们的模型是因果模型,纯在线跟踪,消除了跟踪特定的归纳偏置。这使TAPNext能够实现最小延迟,消除许多现有最先进跟踪器所需的时序窗口。尽管方法简单,TAPNext在线上和离线跟踪器中实现了新的最先进跟踪性能。最后,我们提供证据表明,许多广泛使用的跟踪启发式方法在TAPNext通过端到端训练中自然出现。TAPNext模型和代码可在https://tap-next.github.io/上找到。
引用
@article{arxiv.2504.05579,
title = {TAPNext: Tracking Any Point (TAP) as Next Token Prediction},
author = {Artem Zholus and Carl Doersch and Yi Yang and Skanda Koppula and Viorica Patraucean and Xu Owen He and Ignacio Rocco and Mehdi S. M. Sajjadi and Sarath Chandar and Ross Goroshin},
journal= {arXiv preprint arXiv:2504.05579},
year = {2025}
}