中文

Aria-NeRF:多模态自我中心视角合成

计算机视觉与模式识别 2024-03-20 v2 人工智能

摘要

我们致力于加速基于神经辐射场(NeRFs)启发的可微体积光线追踪、从自我中心数据训练得到的丰富多模态场景模型的研究。从自我中心图像序列构建类NeRF模型,对理解人类行为至关重要,并在VR/AR领域具有多样应用。此类自我中心类NeRF模型可用作真实模拟,显著推进能够执行现实任务的智能体发展。未来自我中心视角合成可能超越当今NeRF,通过以多模态传感器增强视觉数据,如用于自运动追踪的IMU、捕捉表面纹理与人类语言语境的音频传感器,以及推断场景中人类注意模式的眼动追踪器,带来新颖环境表征。为支持并促进自我中心多模态场景建模的开发与评估,我们呈现一个全面的多模态自我中心视频数据集。该数据集提供全面的传感数据收集,包含RGB图像、眼动追踪相机画面、麦克风录音、气压计大气压力读数、GPS坐标、Wi-Fi与蓝牙连接详情,以及配磁强计的双频IMU数据集(1kHz与800Hz)。数据集使用Meta Aria Glasses可穿戴设备平台采集。该数据集中多样的数据模态与现实语境,作为深化人类行为理解与实现VR、AR及机器人领域更沉浸智能体验的坚实根基。

关键词

引用

@article{arxiv.2311.06455,
  title  = {Aria-NeRF: Multimodal Egocentric View Synthesis},
  author = {Jiankai Sun and Jianing Qiu and Chuanyang Zheng and John Tucker and Javier Yu and Mac Schwager},
  journal= {arXiv preprint arXiv:2311.06455},
  year   = {2024}
}