中文

3D-Fixer:从单张图像进行 3D 场景的粗到细原位补全

计算机视觉与模式识别 2026-04-07 v1

摘要

从单一视角进行组合式 3D 场景生成需要同时恢复场景布局和 3D 资产。现有方法主要分为两类:前馈生成方法和逐实例生成方法。前者通过高效的网络推理直接预测具有显式 6DoF 位姿的 3D 资产,但它们在复杂场景上的泛化能力较差。后者通过分治策略改善泛化性,但耗时较多的位姿优化使其效率较低。为弥合这一差距,我们提出 3D-Fixer,一种新颖的原位补全范式。具体而言,3D-Fixer 扩展了 3D 对象生成先验,以在原始位置处的部分可见点云为条件生成完整的 3D 资产,这些点云是从几何估计方法获得的碎片化几何中裁剪得到的。与需要显式位姿对齐的先前工作不同,3D-Fixer 将碎片化几何用作空间锚点以保持布局保真度。其核心是,我们提出了一种粗到细的生成方案以解决遮挡下的边界模糊问题,该方案由双分支条件网络和遮挡鲁棒特征对齐(ORFA)策略支持,以实现稳定训练。此外,为解决数据稀缺瓶颈,我们提出了 ARSG-110K,这是迄今为止最大的场景级数据集,包含超过 110K 个多样化场景和 300 万张带有高保真 3D 真值的标注图像。大量实验表明,3D-Fixer 达到了最先进的几何精度,显著优于 MIDI 和 Gen3DSR 等基线方法,同时保持了扩散过程的效率。代码和数据将在 https://zx-yin.github.io/3dfixer 公开获取。

关键词

引用

@article{arxiv.2604.04406,
  title  = {3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image},
  author = {Ze-Xin Yin and Liu Liu and Xinjie Wang and Wei Sui and Zhizhong Su and Jian Yang and Jin Xie},
  journal= {arXiv preprint arXiv:2604.04406},
  year   = {2026}
}

备注

17 pages, 10 figures, CVPR 2026, project page: https://zx-yin.github.io/3dfixer