DiffCAD:基于RGB图像的弱监督概率化CAD模型检索与对齐
计算机视觉与模式识别
2024-06-07 v2
摘要
基于CAD模型基元从RGB图像感知三维结构,能够实现高效且有效的场景三维基于对象的表示。然而,现有方法依赖于与真实图像关联的CAD模型的昂贵标注作为监督,并因任务固有的模糊性而面临挑战——既包括单目感知中的深度-尺度模糊性,也包括CAD数据库模型与真实观测的不精确匹配。为此,我们提出DiffCAD,首个从RGB图像进行CAD检索与对齐的弱监督概率方法。我们将该任务表述为条件生成任务,利用扩散学习捕捉图像中CAD对象的形状、位姿与尺度的隐式概率模型。这使得能够多假设生成不同的合理CAD重建结果,仅需少量假设即可刻画深度/尺度模糊性与不精确形状匹配。我们的方法仅在合成数据上训练,利用单目深度与掩码估计实现对任意真实目标领域的鲁棒零样本适应。尽管仅在合成数据上训练,我们的多假设方法在Scan2CAD数据集上以8个假设甚至超越有监督最先进水平5.9%。
引用
@article{arxiv.2311.18610,
title = {DiffCAD: Weakly-Supervised Probabilistic CAD Model Retrieval and Alignment from an RGB Image},
author = {Daoyi Gao and Dávid Rozenberszki and Stefan Leutenegger and Angela Dai},
journal= {arXiv preprint arXiv:2311.18610},
year = {2024}
}
备注
SIGGRAPH 2024, Project page: https://daoyig.github.io/DiffCAD/