中文

环视并关注:基于 Transformer 的多摄像头点跟踪新思路

计算机视觉与模式识别 2025-12-05 v1

摘要

本文提出了 LAPA (Look Around and Pay Attention),一种新型基于 Transformer 的端到端多摄像头点跟踪架构,通过整合基于外观的匹配和几何约束。传统管道将检测、关联和跟踪分离,导致在挑战性场景中出现误差传播和时序不一致。LAPA 通过利用注意力机制在视角和时间上进行联合推理,建立通过增强了几何先验的跨视角注意力机制所建立的软对应关系。我们不依赖经典三角测量,而是通过注意力加权聚合构建 3D 点表示,能够本质上容纳不确定性和部分观测。通过建模长程依赖的 Transformer 解码器进一步维持时序一致性,通过持久化延长遮挡下的身份识别。在包括我们新创建的 TAPVid-3D 多摄像头 (MC) 版本和 PointOdyssey MC 版本在内的挑战性数据集上进行了大量实验,显示我们的统一方法在现有方法上显著优于,特别是在复杂运动和遮挡场景中表现突出。

关键词

引用

@article{arxiv.2512.04213,
  title  = {Look Around and Pay Attention: Multi-camera Point Tracking Reimagined with Transformers},
  author = {Bishoy Galoaa and Xiangyu Bai and Shayda Moezzi and Utsav Nandi and Sai Siddhartha Vivek Dhir Rangoju and Somaieh Amraee and Sarah Ostadabbas},
  journal= {arXiv preprint arXiv:2512.04213},
  year   = {2025}
}