中文

MVTOP:基于多视角 Transformer 的物体姿态估计

计算机视觉与模式识别 2026-03-24 v1

摘要

我们提出 MVTOP,一种新颖的基于 Transformer 的多视角刚体姿态估计方法。通过对视角特有的特征进行早期融合,本方法能够解决单视角或单视角姿态后处理无法解决的歧义问题。MVTOP 通过来自各相机中心的视线来建模多视角几何。虽然该方法假设特定场景下相机内参数和相对姿态已知,但可针对每次推理进行变化,因而具有通用性。利用视线机制,MVTOP 能利用融合后的多视角信息正确预测姿态。为展示模型能力,我们提供了一个只能通过此类整体性多视角方法求解的数据集,因为该数据集中的姿态无法仅通过单一视角求解。我们的模型在该数据集上超越单视角和现有所有多视角方法,同时在 YCB-V 数据集上取得具竞争力的结果。据我们所知,目前尚无可可靠解决此类姿态歧义的整体性多视角方法存在。该模型为端到端可训练,且无需额外数据(如深度信息)。

关键词

引用

@article{arxiv.2508.03243,
  title  = {MVTOP: Multi-View Transformer-based Object Pose-Estimation},
  author = {Lukas Ranftl and Felix Brendel and Bertram Drost and Carsten Steger},
  journal= {arXiv preprint arXiv:2508.03243},
  year   = {2026}
}

备注

9 pages, 7 figures