基于合成数据的鲁棒类别级三维位姿估计
计算机视觉与模式识别
2023-05-26 v1
摘要
获取准确的三维物体位姿对众多计算机视觉应用(如三维重建与场景理解)至关重要。然而,标注真实世界物体耗时且困难。虽然合成生成的训练数据是一种可行替代,但真实与合成数据间的域偏移是重大挑战。本工作中,我们旨在缩小基于合成数据与少量真实图像训练的模型与基于大规模数据全监督模型间的性能差距。我们从两个角度实现该目标:1)我们引入 SyntheticP3D,一种由 CAD 模型生成并经由新算法增强的用于物体位姿估计的合成数据集。2)我们提出一种新方法(CC3D)用于训练通过逆渲染执行位姿估计的神经网格模型。特别地,我们利用网格表面特征间的空间关系与对比学习方案引导域适应过程。二者结合使我们的模型仅使用相应真实训练图像的 10% 即可与最先进模型竞争,而仅用 50% 真实训练数据并以 pi/18 为阈值时超越 SOTA 模型 10.4%。我们训练的模型虽仅以极少真实数据训练,仍展现出对分布外场景的鲁棒泛化能力。
引用
@article{arxiv.2305.16124,
title = {Robust Category-Level 3D Pose Estimation from Synthetic Data},
author = {Jiahao Yang and Wufei Ma and Angtian Wang and Xiaoding Yuan and Alan Yuille and Adam Kortylewski},
journal= {arXiv preprint arXiv:2305.16124},
year = {2023}
}