中文

HUGS:基于高斯泼溅的整体城市场景三维理解

计算机视觉与模式识别 2024-03-20 v1

摘要

基于 RGB 图像的整体城市场景理解是一个具有挑战性但又重要的问题。它包括理解几何和外观以实现新视角合成、解析语义标签和跟踪运动目标。尽管取得了相当大的进展,但现有方法通常关注该任务的特定方面,并需要额外的输入,如 LiDAR 扫描或手动标注的 3D 边界框。在本文中,我们引入了一种利用 3D Gaussian Splatting 进行整体城市场景理解的新流水线。我们的主要思想涉及使用静态和动态 3D 高斯组合对几何、外观、语义和运动进行联合优化,其中运动目标位姿通过物理约束进行正则化。我们的方法能够实时渲染新视角,产生高精度的 2D 和 3D 语义信息,并重建动态场景,即使在 3D 边界框检测高度嘈杂的场景中也是如此。在 KITTI、KITTI-360 和 Virtual KITTI 2 上的实验结果证明了我们方法的有效性。

关键词

引用

@article{arxiv.2403.12722,
  title  = {HUGS: Holistic Urban 3D Scene Understanding via Gaussian Splatting},
  author = {Hongyu Zhou and Jiahao Shao and Lu Xu and Dongfeng Bai and Weichao Qiu and Bingbing Liu and Yue Wang and Andreas Geiger and Yiyi Liao},
  journal= {arXiv preprint arXiv:2403.12722},
  year   = {2024}
}

备注

Our project page is at https://xdimlab.github.io/hugs_website