EmerNeRF:基于自监督涌现的时空场景分解
计算机视觉与模式识别
2023-11-06 v1
摘要
我们提出 EmerNeRF,一种简单而强大的用于学习动态驾驶场景时空表示的方法。基于神经场,EmerNeRF 通过自举方式同时捕获场景几何、外观、运动与语义。EmerNeRF 依赖于两个核心组件:首先,它将场景划分为静态场与动态场。这种分解纯粹从自监督中涌现,使我们的模型能够从通用的、真实世界野外的数据源中学习。其次,EmerNeRF 从动态场参数化一个诱导流场,并利用该流场进一步聚合多帧特征,提升动态物体的渲染精度。耦合这三个场(静态、动态与流)使 EmerNeRF 能够自给自足地表示高度动态场景,无需依赖真实物体标注或用于动态物体分割与光流估计的预训练模型。我们的方法在传感器仿真中达到最先进性能,在重建静态(+2.93 PSNR)与动态(+3.70 PSNR)场景时显著优于先前方法。此外,为增强 EmerNeRF 的语义泛化能力,我们将 2D 视觉基础模型特征提升入 4D 时空,并解决现代 Transformer 中普遍的位置偏置,显著提升 3D 感知性能(例如占用预测精度平均相对提升 37.50%)。最后,我们构建了一个多样且具挑战性的 120 序列数据集,以在极端与高度动态设定下评测神经场。
引用
@article{arxiv.2311.02077,
title = {EmerNeRF: Emergent Spatial-Temporal Scene Decomposition via Self-Supervision},
author = {Jiawei Yang and Boris Ivanovic and Or Litany and Xinshuo Weng and Seung Wook Kim and Boyi Li and Tong Che and Danfei Xu and Sanja Fidler and Marco Pavone and Yue Wang},
journal= {arXiv preprint arXiv:2311.02077},
year = {2023}
}
备注
See the project page for code, data, and request pre-trained models: https://emernerf.github.io