EPro-PnP:面向单目物体姿态估计的广义端到端概率Perspective-n-Points方法
计算机视觉与模式识别
2023-12-19 v3
摘要
通过Perspective-n-Point(PnP,透视n点)从单张RGB图像定位3D物体是计算机视觉中一个长期存在的问题。在端到端深度学习的驱动下,近期研究建议将PnP解释为可微分层,允许通过反向传播姿态损失的梯度来部分学习2D-3D点对应关系。然而,从头学习全部对应关系极具挑战性,尤其对于模糊姿态解,其全局最优姿态在点上理论上是不可微的。本文提出EPro-PnP,一种用于通用端到端姿态估计的概率PnP层,其在SE(3)流形上输出具有可微概率密度的姿态分布。2D-3D坐标及对应权重被视为通过最小化预测姿态分布与目标姿态分布之间KL散度来学习的中间变量。其底层原理推广了先前方法,并类似于注意力机制。EPro-PnP可增强现有对应网络,在LineMOD 6DoF姿态估计基准上缩小了基于PnP的方法与任务专用领先方法之间的差距。此外,EPro-PnP有助于探索网络设计的新可能,如我们展示了一种在nuScenes 3D物体检测基准上具有最先进姿态精度的新颖可变形对应网络。我们的代码位于 https://github.com/tjiiv-cprg/EPro-PnP-v2。
引用
@article{arxiv.2303.12787,
title = {EPro-PnP: Generalized End-to-End Probabilistic Perspective-n-Points for Monocular Object Pose Estimation},
author = {Hansheng Chen and Wei Tian and Pichao Wang and Fan Wang and Lu Xiong and Hao Li},
journal= {arXiv preprint arXiv:2303.12787},
year = {2023}
}
备注
Code available at https://github.com/tjiiv-cprg/EPro-PnP-v2. Revised and fixed typos. arXiv admin note: substantial text overlap with arXiv:2203.13254