从单目视频神经捕获可动画 3D 人体
计算机视觉与模式识别
2022-08-19 v1
摘要
我们提出了一种从单目视频输入构建可动画 3D 人体表示的新范式,使其能够在任意未见姿态和视角下渲染。我们的方法基于由作为几何代理的基于网格的参数化 3D 人体模型绑定的动态神经辐射场(NeRF)。先前的方法通常依赖多目视频或精确 3D 几何信息作为额外输入;此外,大多数方法在泛化到未见姿态时质量下降。我们认识到泛化的关键在于用于查询动态 NeRF 的良好输入嵌入:良好的输入嵌入应在完整体积空间中定义单射映射,并由姿态变化下的表面网格形变引导。基于该观察,我们提出将输入查询与其在网格顶点上的一组测地最近邻所张成的局部表面区域的关系进行嵌入。通过同时包含位置和相对距离信息,我们的嵌入定义了保距形变映射,并很好地泛化到未见姿态。为减少对额外输入的依赖,我们首先使用现成工具初始化逐帧 3D 网格,然后提出一种联合优化 NeRF 并精化初始网格的流程。大量实验表明,我们的方法能在未见姿态和视角下合成合理的人体渲染结果。
引用
@article{arxiv.2208.08728,
title = {Neural Capture of Animatable 3D Human from Monocular Video},
author = {Gusi Te and Xiu Li and Xiao Li and Jinglu Wang and Wei Hu and Yan Lu},
journal= {arXiv preprint arXiv:2208.08728},
year = {2022}
}
备注
ECCV 2022