中文

SUDS:可扩展的城市动态场景重建

计算机视觉与模式识别 2023-03-28 v1 图形学 机器学习

摘要

我们将神经辐射场(NeRFs)扩展到动态大规模城市场景。先前工作倾向于重建短时长(至多 10 秒)的单段视频。原因有二:(a) 此类方法随运动物体与输入视频数量线性扩展,因每个都构建独立模型;(b) 往往需要借助手动或类别特定模型获得的 3D 边界框与全景标签作为监督。作为迈向真正开放世界动态城市重建的一步,我们引入两项关键创新:(a) 我们将场景分解为三个独立的哈希表数据结构,以高效编码静态、动态与远场辐射场;(b) 我们利用由 RGB 图像、稀疏 LiDAR、现成自监督 2D 描述子以及最重要的 2D 光流组成的无标签目标信号。通过光度、几何与特征度量重建损失运用此类输入,使 SUDS 能将动态场景分解为静态背景、独立物体及其运动。当与我们的多分支表表示结合时,此类重建可扩展到来自 1700 段视频、涵盖数百公里地理空间的 120 万帧中数万个物体,(据我们所知)是迄今最大的动态 NeRF。我们展示了由我们的表示所赋能的多种任务的定性初步结果,包括动态城市场景的新视角合成、无监督 3D 实例分割与无监督 3D 长方体检测。为与先前工作比较,我们还在 KITTI 与 Virtual KITTI 2 上评估,超越了依赖真值 3D 边界框标注的当前最优方法,同时训练速度快 10 倍。

关键词

引用

@article{arxiv.2303.14536,
  title  = {SUDS: Scalable Urban Dynamic Scenes},
  author = {Haithem Turki and Jason Y. Zhang and Francesco Ferroni and Deva Ramanan},
  journal= {arXiv preprint arXiv:2303.14536},
  year   = {2023}
}

备注

CVPR 2023 Project page: https://haithemturki.com/suds/