中文

面向自主系统的可迁移多模态感知表征学习:NeRF 监督的掩码自编码器

计算机视觉与模式识别 2023-12-07 v2 人工智能 机器学习 机器人学

摘要

本工作提出了一种统一的自监督预训练框架,通过神经辐射场(NeRF)中的掩码多模态重建实现可迁移多模态感知表征学习,即 NeRF 监督的掩码自编码器(NS-MAE)。具体而言,在给定某些视角方向与位置条件下,从受损多模态输入信号(即 Lidar 点云与图像)提取的多模态嵌入经由神经渲染被渲染为投影的多模态特征图。随后,原始多模态信号作为渲染多模态特征图的重建目标,以实现自监督表征学习。大量实验表明,通过 NS-MAE 学习的表征在多样的 3D 感知下游任务(3D 目标检测与 BEV 地图分割)上,对多样的多模态及单模态(仅相机与仅 Lidar)感知模型,在不同数量的微调标注数据下均展现出良好的可迁移性。此外,我们通过经验发现 NS-MAE 兼具掩码自编码器机制与神经辐射场的协同优势。我们希望本研究能启发对自主智能体更通用多模态表征学习的探索。

关键词

引用

@article{arxiv.2311.13750,
  title  = {Towards Transferable Multi-modal Perception Representation Learning for Autonomy: NeRF-Supervised Masked AutoEncoder},
  author = {Xiaohao Xu},
  journal= {arXiv preprint arXiv:2311.13750},
  year   = {2023}
}