利用深度形状先验弱监督学习多目标 3D 场景分解
计算机视觉与模式识别
2022-05-04 v5
摘要
以对象粒度表示场景是场景理解和决策制定的先决条件。我们提出了 PriSMONet,一种基于先验形状知识的新方法,用于从单张图像中学习多目标 3D 场景分解和表示。我们的方法学习将平面上具有多个对象的合成场景图像分解为其组成场景对象,并从单一视图推断其 3D 属性。循环编码器从输入 RGB 图像中回归出每个对象的 3D 形状、位姿和纹理的潜在表示。通过可微渲染,我们以自监督方式训练模型从 RGB-D 图像中分解场景。3D 形状在函数空间中连续表示为符号距离函数,我们以监督方式从示例形状中对其进行预训练。这些形状先验提供弱监督信号,以更好地调节具有挑战性的整体学习任务。我们评估了模型在推断 3D 场景布局方面的准确性,展示了其生成能力,评估了其对真实图像的泛化能力,并指出了所学表示的优势。
引用
@article{arxiv.2010.04030,
title = {Weakly Supervised Learning of Multi-Object 3D Scene Decompositions Using Deep Shape Priors},
author = {Cathrin Elich and Martin R. Oswald and Marc Pollefeys and Joerg Stueckler},
journal= {arXiv preprint arXiv:2010.04030},
year = {2022}
}
备注
Preprint accepted to Computer Vision and Image Understanding