中文

6Img-to-3D:少图像大规模户外驾驶场景重建

计算机视觉与模式识别 2025-04-08 v2 人工智能 机器学习

摘要

当前的3D重建技术难以从少量图像中忠实地推断无界场景。具体来说,现有方法计算需求高,需要详细的位姿信息,并且无法可靠地重建遮挡区域。我们引入了6Img-to-3D,一种高效、可扩展的基于Transformer的编码器-渲染器方法,用于单次图像到3D重建。我们的方法仅从六张朝外的输入图像中输出一个3D一致的参数化三平面,用于大规模、无界的户外驾驶场景。我们通过结合用于三平面参数化的收缩定制交叉注意力和自注意力机制、可微分体渲染、场景收缩和图像特征投影,朝着解决现有缺陷迈出了一步。我们展示了来自单个时间戳的六张环视车辆图像,无需全局位姿信息,就足以在推理时间内重建360°场景,耗时395毫秒。我们的方法允许例如渲染第三人称图像和鸟瞰图。我们的代码可在https://github.com/continental/6Img-to-3D获取,更多示例可在我们的网站https://6Img-to-3D.GitHub.io/找到。

关键词

引用

@article{arxiv.2404.12378,
  title  = {6Img-to-3D: Few-Image Large-Scale Outdoor Driving Scene Reconstruction},
  author = {Théo Gieruc and Marius Kästingschäfer and Sebastian Bernhard and Mathieu Salzmann},
  journal= {arXiv preprint arXiv:2404.12378},
  year   = {2025}
}

备注

IV 2025. Joint first authorship. Project page: https://6Img-to-3D.GitHub.io/ Code https://github.com/continental/6Img-to-3D