MonoNeRF:从单目视频中学习可泛化的动态辐射场
计算机视觉与模式识别
2023-08-16 v3
摘要
本文针对从单目视频中学习可泛化动态辐射场的问题。与大多数基于多视图的现有NeRF方法不同,单目视频在每个时间戳仅包含单一视图,因此在估计点特征与场景流时沿视图方向存在歧义。DynNeRF等先前研究通过位置编码消除点特征歧义,但该方法不可迁移且严重限制泛化能力。因此,这些方法须为每个场景训练独立模型,并在应用于真实世界中不断增加的单目视频时面临沉重计算开销。为此,我们提出MonoNeRF,借助跨帧的点轨迹与特征对应约束同时学习点特征和场景流。具体而言,我们学习一个隐式速度场,通过Neural ODE从时间特征估计点轨迹,随后接一个基于流的聚合模块以沿点轨迹获取空间特征。我们以端到端方式联合优化时间与空间特征。实验表明,我们的MonoNeRF能够从多场景学习,并支持场景编辑、未见帧合成和快速新场景适配等新应用。代码见https://github.com/tianfr/MonoNeRF。
引用
@article{arxiv.2212.13056,
title = {MonoNeRF: Learning a Generalizable Dynamic Radiance Field from Monocular Videos},
author = {Fengrui Tian and Shaoyi Du and Yueqi Duan},
journal= {arXiv preprint arXiv:2212.13056},
year = {2023}
}
备注
Accepted by ICCV 2023