中文

KV-Tracker:基于Transformer的实时姿态跟踪

计算机视觉与模式识别 2025-12-30 v1

摘要

多视图3D几何网络虽然提供了强大的先验条件,但却难以用于实时应用。我们提出一种新颖的方法,将其适用于在线使用,实现来自单目RGB视频的6自由度姿态跟踪和对对象和场景的在线重建。我们的方法快速选择并管理一组图像作为关键帧,通过 π3\pi^3 进行场景或对象的映射,实现完全双向注意力。随后我们缓存全局自注意力块的键值(KV)对,并将其用作在线跟踪的唯一场景表示。这使得在推理期间无需担心漂移或灾难性遗忘的情况下实现最高可达 15×15\times 的加速。我们的缓存策略具有模型无关性,可应用于其他即插即用多视图网络而无需重新训练。我们在场景级跟踪以及更具挑战性的无深度测量或对象先验条件下的即时对象跟踪和重建任务上演示了KV-Tracker。在TUM RGB-D、7-Scenes、Arctic和OnePose数据集上的实验表明,该系统在保持高达 27{\sim}27 FPS的帧率的同时表现出色。

关键词

引用

@article{arxiv.2512.22581,
  title  = {KV-Tracker: Real-Time Pose Tracking with Transformers},
  author = {Marwan Taher and Ignacio Alzugaray and Kirill Mazur and Xin Kong and Andrew J. Davison},
  journal= {arXiv preprint arXiv:2512.22581},
  year   = {2025}
}

备注

Project Page: https://marwan99.github.io/kv_tracker