MVTOP:基于多视角 Transformer 的物体姿态估计
计算机视觉与模式识别
2026-03-24 v1
摘要
我们提出 MVTOP,一种新颖的基于 Transformer 的多视角刚体姿态估计方法。通过对视角特有的特征进行早期融合,本方法能够解决单视角或单视角姿态后处理无法解决的歧义问题。MVTOP 通过来自各相机中心的视线来建模多视角几何。虽然该方法假设特定场景下相机内参数和相对姿态已知,但可针对每次推理进行变化,因而具有通用性。利用视线机制,MVTOP 能利用融合后的多视角信息正确预测姿态。为展示模型能力,我们提供了一个只能通过此类整体性多视角方法求解的数据集,因为该数据集中的姿态无法仅通过单一视角求解。我们的模型在该数据集上超越单视角和现有所有多视角方法,同时在 YCB-V 数据集上取得具竞争力的结果。据我们所知,目前尚无可可靠解决此类姿态歧义的整体性多视角方法存在。该模型为端到端可训练,且无需额外数据(如深度信息)。
关键词
引用
@article{arxiv.2508.03243,
title = {MVTOP: Multi-View Transformer-based Object Pose-Estimation},
author = {Lukas Ranftl and Felix Brendel and Bertram Drost and Carsten Steger},
journal= {arXiv preprint arXiv:2508.03243},
year = {2026}
}
备注
9 pages, 7 figures