是否进行视图转换:基于NeRF的预训练视角
计算机视觉与模式识别
2026-03-31 v1
摘要
神经辐射场(NeRF)已成为面向视觉的自主驾驶中一种突出的预训练范式,通过完全无监督的方式增强3D几何和外观理解。要将NeRF-based预训练应用于3D感知模型,最近的方法仅对从视图转换获得的体积特征简单应用NeRF。然而,将NeRF与视图转换组合会继承相互矛盾的先验假设:视图转换施加离散和刚性表示,而辐射场假设连续和自适应函数。当这些相互对立的假设被强行融合到单个管道中时,便会表现为模糊和模棱两可的3D表示,从而最终限制了3D场景理解。此外,针对预训练的NeRF网络在下游任务中被丢弃,导致无法有效利用通过NeRF所增强的3D表示。在本文中,我们提出一种新颖的NeRF-Resembled Point-based 3D 检测器,能够学习连续3D表示,从而避免视图转换引入的不一致先验。NeRP3D保留预训练的NeRF网络 regardless of 任务,继承连续3D表示学习的原则,为场景重建和检测任务提供更大的潜力。在nuScenes数据集上的实验表明,我们的方法显著改进了前所未有的SOTA方法,不仅在下文本感知任务,还在前提场景重建任务中取得优异成绩。
引用
@article{arxiv.2603.28090,
title = {To View Transform or Not to View Transform: NeRF-based Pre-training Perspective},
author = {Hyeonjun Jeong and Juyeb Shin and Dongsuk Kum},
journal= {arXiv preprint arXiv:2603.28090},
year = {2026}
}
备注
The Fourteenth International Conference on Learning Representations (ICLR'26)