CoL3D:用于度量三维形状恢复的单视图深度与相机内参的协同学习
计算机视觉与模式识别
2025-02-14 v1
摘要
从单张图像恢复度量三维形状在机器人和具身智能应用中具有重要意义,因为准确的空间理解对于环境导航和与环境交互至关重要。通常,主流方法是通过单目深度估计来实现。然而,由于缺乏相机内参,无法仅凭深度信息恢复三维度量形状。本研究在理论上证明,深度作为三维先验约束可用于估计相机内参,并揭示了这两者之间的相互关系。基于此,我们提出了一种协同学习框架,用于联合估计深度和相机内参,称为CoL3D,从单张图像学习度量三维形状。具体而言,CoL3D采用统一网络,在三个层面上进行协同优化:深度、相机内参和三维点云。对于相机内参,我们设计了标准 incid 场机制作为先验,使模型能够学习残差 incid 场,以实现更精准的标定。此外,我们在点云空间中引入形状相似度测量损失,这有助于提高机器人应用所必需的三维形状质量。因此,在单一数据集上进行的训练和测试中,CoL3D在多个室内和户外基准数据集上在深度估计和相机标定方面均表现出色,为机器人感知能力带来显著的三维形状质量提升。
引用
@article{arxiv.2502.08902,
title = {CoL3D: Collaborative Learning of Single-view Depth and Camera Intrinsics for Metric 3D Shape Recovery},
author = {Chenghao Zhang and Lubin Fan and Shen Cao and Bojian Wu and Jieping Ye},
journal= {arXiv preprint arXiv:2502.08902},
year = {2025}
}
备注
Accepted at ICRA 2025