面向自主系统的可迁移多模态感知表征学习:NeRF 监督的掩码自编码器
计算机视觉与模式识别
2023-12-07 v2 人工智能
机器学习
机器人学
摘要
本工作提出了一种统一的自监督预训练框架,通过神经辐射场(NeRF)中的掩码多模态重建实现可迁移多模态感知表征学习,即 NeRF 监督的掩码自编码器(NS-MAE)。具体而言,在给定某些视角方向与位置条件下,从受损多模态输入信号(即 Lidar 点云与图像)提取的多模态嵌入经由神经渲染被渲染为投影的多模态特征图。随后,原始多模态信号作为渲染多模态特征图的重建目标,以实现自监督表征学习。大量实验表明,通过 NS-MAE 学习的表征在多样的 3D 感知下游任务(3D 目标检测与 BEV 地图分割)上,对多样的多模态及单模态(仅相机与仅 Lidar)感知模型,在不同数量的微调标注数据下均展现出良好的可迁移性。此外,我们通过经验发现 NS-MAE 兼具掩码自编码器机制与神经辐射场的协同优势。我们希望本研究能启发对自主智能体更通用多模态表征学习的探索。
引用
@article{arxiv.2311.13750,
title = {Towards Transferable Multi-modal Perception Representation Learning for Autonomy: NeRF-Supervised Masked AutoEncoder},
author = {Xiaohao Xu},
journal= {arXiv preprint arXiv:2311.13750},
year = {2023}
}