中文

Uni3R:通过从未定位多视图图像中通用高斯溅写实现统一3D重建与语义理解

计算机视觉与模式识别 2026-03-25 v4

摘要

从稀疏2D视图重建和语义解释3D场景是计算机视觉中的一个基本挑战。常规方法通常将语义理解与重建解耦,或需要昂贵的 per-scene 优化,从而限制了其可扩展性和通用性。本文提出 Uni3R,一种新型 feed-forward 框架,用于从未定位的多视图图像中联合重建以开放词汇语义丰富的统一3D场景表示。我们的做法利用 Cross-View Transformer 对任意多视图输入进行稳健集成,然后回归一组以语义特征场赋能的3D 高斯原始素。该统一表示 facilitate 高保真新视图合成、开放词汇3D语义分割和深度预测,全部在单个 feed-forward pass 中完成。广泛实验表明,Uni3R 在多个基准上建立了新的 state-of-the-art,包括 RE10K 上的 25.07 PSNR 和 ScanNet 上的 55.84 mIoU。我们的工作标志着通用、统一3D场景重建与理解的新范式。代码地址为 https://github.com/HorizonRobotics/Uni3R。

关键词

引用

@article{arxiv.2508.03643,
  title  = {Uni3R: Unified 3D Reconstruction and Semantic Understanding via Generalizable Gaussian Splatting from Unposed Multi-View Images},
  author = {Xiangyu Sun and Haoyi Jiang and Liu Liu and Seungtae Nam and Gyeongjin Kang and Xinjie Wang and Wei Sui and Zhizhong Su and Wenyu Liu and Xinggang Wang and Eunbyung Park},
  journal= {arXiv preprint arXiv:2508.03643},
  year   = {2026}
}

备注

The code is available at https://github.com/HorizonRobotics/Uni3R