TAPNext++:面向任意点跟踪(TAP)的下一代方法
计算机视觉与模式识别
2026-04-14 v1
摘要
Tracking-Any-Point(TAP)模型旨在跟踪视频中任意点,这是AR/XR和机器人应用中的关键任务。最近提出的TAPNext方法提出了一种端到端、循环变换器架构,按纯在线方式逐帧跟踪点,显示出在最小延迟下的竞争性能。然而,我们发现TAPNext在处理更长视频序列时存在困难,并且经常无法重新检测到被遮挡或离开画面的查询点。本文提出TAPNext++,一种能够在序列长度远大于TAPNext的范围内跟踪点的模型,同时保持该架构的低内存和计算占用。我们采用多种数据驱动方法训练循环视频变换器,包括利用序列并行技术在长1024帧序列上进行训练。我们指出,当前文献中重新检测性能是一个盲点,提出了新的评估指标Re-Detection Average Jaccard(AJ_{RD}),用于显式评估在重新出现的点上的跟踪性能。为提高点重检性能,我们引入了量身定制的几何数据增强,如周期性翻滚以模拟点的重新进入,以及对遮挡点的监督。我们展示,循环变换器可显著改进点跟踪,使其在多个基准测试上达到新的状态-of-the-art。模型和代码可在https://tap-next-plus-plus.github.io找到。
引用
@article{arxiv.2604.10582,
title = {TAPNext++: What's Next for Tracking Any Point (TAP)?},
author = {Sebastian Jung and Artem Zholus and Martin Sundermeyer and Carl Doersch and Ross Goroshin and David Joseph Tan and Sarath Chandar and Rudolph Triebel and Federico Tombari},
journal= {arXiv preprint arXiv:2604.10582},
year = {2026}
}
备注
8 pages, will be publised at CVPR Findings 2026, Website https://tap-next-plus-plus.github.io