Glissando-Net:深度 sinGLe vIew 类别级姿态估计与 3D 重建
计算机视觉与模式识别
2025-01-28 v1
摘要
我们提出一种深度学习模型,命名为 Glissando-Net,用于从单张 RGB 图像同时估计物体的姿态并重建其 3D 形状。以往工作主要聚焦于估计姿态(常为实例级)或重建形状,但两者兼顾。Glissando-Net 由两个 auto-encoders 组成,这两个 auto-encoders 在联合训练下工作,一个用于 RGB 图像,另一个用于点云。我们在 Glissando-Net 中采纳了两种关键设计选择,以实现对给定单张 RGB 图像输入下对物体 3D 形状和姿态的更精确预测。第一,we 将点云编码器和解码器的特征图与来自图像解码器转换后的特征图相 Augment,以在训练和预测中实现有效的 2D-3D 交互。第二,我们在解码器阶段预测物体的 3D 形状和姿态。如此一来,我们更好地利用了仅在训练阶段可见的 3D 点云中的信息,以便在训练时更准确地预测。我们联合训练两个用于 RGB 和点云数据的 encoder-decoder,以学习如何在推理期间将潜在特征传递给点云解码器。在测试中,抛弃 3D 点云的编码器。Glissando-Net 的设计灵感来源于 codeSLAM。不同于 codeSLAM,后者针对场景的 3D 重建,我们关注物体的姿态估计和形状重建,直接预测物体姿态和不依赖 code 优化步骤的姿态不变 3D 重建。广泛的实验,包括消融研究与与竞争方法的比较,证明了我们方法的有效性,并与最新方法相比较优异。
引用
@article{arxiv.2501.14896,
title = {Glissando-Net: Deep sinGLe vIew category level poSe eStimation ANd 3D recOnstruction},
author = {Bo Sun and Hao Kang and Li Guan and Haoxiang Li and Philippos Mordohai and Gang Hua},
journal= {arXiv preprint arXiv:2501.14896},
year = {2025}
}
备注
15 pages, 13 Figures, accepted to TPAMI -- IEEE Transactions on Pattern Analysis and Machine Intelligence (2024)