中文

LAMP:基于局部化的多摄像头人群三维跟踪

计算机视觉与模式识别 2026-05-08 v1

摘要

从佩戴式多摄像头头盔进行 3D 人体运动跟踪面临严重的自身运动、部分可见性或遮挡以及缺乏训练数据的挑战。现有方法为单目视频所设计,往往需要静态或缓慢移动的摄像头,无法有效利用多视角、已校准且已定位的输入。这使得它们在动态佩戴式捕获场景中脆弱且容易失败。我们提出 LAMP(Localization Aware Multi-camera People Tracking),即一种新颖且简单的框架,通过早期解耦观察者与目标运动来解决此问题。LAMP 引入两个步骤。首先,我们利用已知设备 6 自由度运动和校准,将所有摄像头在时间窗口内检测到的 2D 身体关键点转换为统一的 3D 世界参考系。其次,一个端到端训练的时空变换器直接将 3D 人体运动拟合到该 3D 射线云中。这种“提升后拟合”方法使 LAMP 能够学习并利用世界空间中自然的人体运动先验,同时为灵活地整合来自多个时间不完全同步、部分观测且移动摄像头的信息提供了一个优雅的框架。LAMP 在单目基准上实现了最新成果,同时在针对我们目标佩戴式场景的条件下显著优于基线方法。

关键词

引用

@article{arxiv.2605.05390,
  title  = {LAMP: Localization Aware Multi-camera People Tracking in Metric 3D World},
  author = {Nan Yang and Julian Straub and Fan Zhang and Richard Newcombe and Jakob Engel and Lingni Ma},
  journal= {arXiv preprint arXiv:2605.05390},
  year   = {2026}
}

备注

CVPR 2026. Project page: https://facebookresearch.github.io/LAMP