MESC-3D:从单幅图像中挖掘有效语义线索以进行 3D 重建
计算机视觉与模式识别
2025-03-03 v1
摘要
从单幅图像重建 3D 形状在计算机视觉中具有重要作用。目前已提出了许多方法并取得了令人瞩目的性能。然而,现有方法主要侧重于从图像中提取语义信息,然后简单地将其与 3D 点云拼接,而未对拼接后的语义进行进一步探索。因此,这些耦合的语义特征显著阻碍了重建性能。在本文中,我们提出了一种新颖的单图像 3D 重建方法,称为 Mining Effective Semantic Cues for 3D Reconstruction from a Single Image(MESC-3D,从单幅图像中挖掘有效语义线索以进行 3D 重建),该方法能够从耦合特征中主动挖掘有效语义线索。具体而言,我们设计了一个有效语义挖掘模块,以建立点云与图像语义属性之间的联系,使点云能够自主选择所需信息。此外,为了解决单幅图像中语义信息可能存在的不足(如遮挡问题),受人类利用日常经验中的先验知识表征 3D 物体能力的启发,我们引入了 3D 语义先验学习模块。该模块融入了对空间结构的语义理解,使模型能够以更高的精度和真实感解释并重建 3D 物体,紧密贴合人类对复杂 3D 环境的感知。大量评估表明,与以往工作相比,我们的方法在重建质量和鲁棒性方面均取得了显著提升。此外,进一步的实验验证了该方法强大的泛化能力,并在未见类别上表现出卓越的零样本性能。代码可在 https://github.com/QINGQINGLE/MESC-3D 获取。
引用
@article{arxiv.2502.20861,
title = {MESC-3D:Mining Effective Semantic Cues for 3D Reconstruction from a Single Image},
author = {Shaoming Li and Qing Cai and Songqi Kong and Runqing Tan and Heng Tong and Shiji Qiu and Yongguo Jiang and Zhi Liu},
journal= {arXiv preprint arXiv:2502.20861},
year = {2025}
}
备注
Published in CVPR 2025