中文

DCL-Net:用于6D位姿估计的深度对应学习网络

计算机视觉与模式识别 2022-10-13 v1

摘要

建立相机坐标系与物体坐标系之间的点对应关系是求解6D物体位姿的一种有前景的方法。然而,在3D空间中对应学习的代理目标与物体位姿估计的真实目标存在差距,使得学习过程对于最终任务是次优的。在本文中,我们通过引入一种用于直接6D物体位姿估计的深度对应学习网络新方法(简称为DCL-Net)来解决这一缺陷。具体而言,DCL-Net采用新提出的双重特征解耦与对齐(FDA)模块,在特征空间中分别为部分物体观测及其完整CAD模型建立部分到部分的对应关系以及完整到完整的对应关系,从而聚合来自两个坐标系的位姿与匹配特征对;因此这两个FDA模块带来了互补优势。匹配特征对用于学习置信度分数以衡量深度对应的质量,而位姿特征对则通过置信度分数加权以进行直接的物体位姿回归。此外,还提出了一种基于置信度的位姿优化网络,以迭代方式进一步提高位姿精度。大量实验表明,DCL-Net在包括YCB-Video、LineMOD和Occlusion-LineMOD在内的三个基准数据集上优于现有方法;消融实验也证实了我们新颖设计的有效性。

关键词

引用

@article{arxiv.2210.05232,
  title  = {DCL-Net: Deep Correspondence Learning Network for 6D Pose Estimation},
  author = {Hongyang Li and Jiehong Lin and Kui Jia},
  journal= {arXiv preprint arXiv:2210.05232},
  year   = {2022}
}