OCH3R:面向对象的整体 3D 重建
计算机视觉与模式识别
2026-05-14 v1
摘要
对象中心的场景理解是计算机视觉中的一个基本挑战。现有方法通常依赖多阶段管道,首先应用预训练的分割器提取单个对象,然后进行逐对象 3D 重建。此类方法计算代价高昂,对分割误差敏感,且随场景复杂度而规模化。我们引入 OCH3R,一个用于从单张 RGB 图像进行面向对象的整体 3D 重建的统一框架。OCH3R 在一次前向传递中同时预测所有对象实例的 6 维姿态和详细的 3D 重建。关键思想是采用 transformer 架构预测每个像素的属性,包括基于 CLIP 的类别嵌入、度量深度、归一化对象坐标 (NOCS) 以及表示每个对象的固定数量的 3D 高斯分布。为监督这些高斯重建,我们将其转换为规范空间并与预渲染的规范参考 ground truth 对齐,避免了昂贵的 per-image 高斯标签生成。在标准室内基准数据集上,OCH3R 实现了单眼深度估计、开放词汇语义分割和 RGB-only 类别级 6D 姿态估计等方面的状态-of-the-art 性能,同时生成高保真、可编辑的逐对象重建。重要的是,推理完全是前向的,并且与对象数量无关地规模化,在杂乱场景中相对于传统多阶段管道实现了数量级的加速。
关键词
引用
@article{arxiv.2605.13018,
title = {OCH3R: Object-Centric Holistic 3D Reconstruction},
author = {Yi Du and Yang You and Xiang Wan and Leonidas Guibas},
journal= {arXiv preprint arXiv:2605.13018},
year = {2026}
}