NeRF-MAE:用于神经辐射场自监督三维表示学习的掩码自编码器
计算机视觉与模式识别
2024-07-19 v3 人工智能
机器学习
摘要
神经场在计算机视觉和机器人领域表现出色,因为它们能够理解三维视觉世界,例如推断语义、几何和动力学。鉴于神经场从二维图像密集表示三维场景的能力,我们提出一个问题:我们能否扩展其自监督预训练,特别是使用掩码自编码器,从带姿态的RGB图像生成有效的三维表示?由于将Transformer扩展到新数据模态取得了惊人成功,我们采用标准的三维视觉Transformer以适应NeRF的独特公式。我们利用NeRF的体积网格作为Transformer的密集输入,与其他三维表示(如点云,其信息密度可能不均匀且表示不规则)形成对比。由于将掩码自编码器应用于隐式表示(如NeRF)存在困难,我们选择提取显式表示,通过使用相机轨迹进行采样来规范化跨域场景。我们的目标通过从NeRF的辐射和密度网格中随机掩码块,并使用标准的三维Swin Transformer重建掩码块来实现。通过这样做,模型可以学习完整场景的语义和空间结构。我们在我们策划的带姿态RGB数据上大规模预训练此表示,总计超过180万张图像。预训练后,编码器用于有效的三维迁移学习。我们新颖的NeRF自监督预训练方法NeRF-MAE具有出色的可扩展性,并在各种具有挑战性的三维任务上提高了性能。利用未标记的带姿态二维数据进行预训练,NeRF-MAE在Front3D和ScanNet数据集上显著优于自监督三维预训练和NeRF场景理解基线,在三维目标检测中绝对性能提升超过20% AP50和8% AP25。
引用
@article{arxiv.2404.01300,
title = {NeRF-MAE: Masked AutoEncoders for Self-Supervised 3D Representation Learning for Neural Radiance Fields},
author = {Muhammad Zubair Irshad and Sergey Zakharov and Vitor Guizilini and Adrien Gaidon and Zsolt Kira and Rares Ambrus},
journal= {arXiv preprint arXiv:2404.01300},
year = {2024}
}
备注
Accepted to ECCV 2024. Project Page: https://nerf-mae.github.io/