PoseStreamer:面向未见过运动物体 3D 跟踪的多模态框架
计算机视觉与模式识别
2026-01-05 v3
摘要
针对新生物体的六自由度 (6DoF) 位姿估计是计算机视觉中的一项关键任务,然而在标准 RGB 相机受运动模糊影响的高速与低光场景中,该任务面临重大挑战。尽管事件相机因其高时间分辨率提供了一种有前景的解决方案,但当前的 6DoF 位姿估计方法在高速物体运动场景下通常表现欠佳。为弥补这一不足,我们提出了 PoseStreamer,这是一个专门针对高速运动场景设计的鲁棒多模态 6DoF 位姿估计框架。该方法集成了三个核心组件:利用历史朝向线索实现时间一致性的自适应位姿记忆队列、提供强 2D 先验以提升 3D 中心点召回率的以物体为中心的 2D 跟踪器,以及用于沿相机射线进行几何优化的射线位姿滤波器。此外,我们引入了 MoCapCube6D,一个为基准测试快速运动下性能而构建的新型多模态数据集。大量实验表明,PoseStreamer 不仅在高速运动场景中实现了卓越的准确率,而且作为无模板框架对未见过运动物体展现出强大的泛化能力。
引用
@article{arxiv.2512.22979,
title = {PoseStreamer: A Multi-modal Framework for 3D Tracking of Unseen Moving Objects},
author = {Huiming Yang and Linglin Liao and Fei Ding and Sibo Wang and Zijian Zeng},
journal= {arXiv preprint arXiv:2512.22979},
year = {2026}
}