BANMo:从大量随手拍摄视频构建可动画的三维神经模型
计算机视觉与模式识别
2023-04-04 v3 图形学
摘要
先前关于关节式三维形状重建的工作通常依赖于专用传感器(例如同步多相机系统)或预构建的三维可变形模型(例如SMAL或SMPL)。此类方法无法扩展到野外多样化物体集合。我们提出BANMo,一种既不需要专用传感器也不需要预定义模板形状的方法。BANMo在可微渲染框架中从大量单目随手视频构建高保真、关节式的三维模型(包括形状和可动画蒙皮权重)。虽然使用大量视频提供了更丰富的相机视角和物体关节运动覆盖,但也带来了跨不同背景、光照条件等场景建立对应关系的重大挑战。我们的核心见解是融合三派思想:(1)利用关节骨骼与混合蒙皮的经典可变形形状模型,(2)适于基于梯度优化的体积神经辐射场(NeRFs),以及(3)在像素与关节式模型间生成对应关系的规范嵌入。我们引入神经混合蒙皮模型,允许可微且可逆的关节式形变。当与规范嵌入结合时,此类模型使我们能够建立跨视频的稠密对应关系,并可通过循环一致性进行自监督。在真实与合成数据集上,BANMo对人类和动物展现出比先前工作更高保真的三维重建,并能从新视角和姿态渲染逼真图像。项目网页:banmo-www.github.io。
引用
@article{arxiv.2112.12761,
title = {BANMo: Building Animatable 3D Neural Models from Many Casual Videos},
author = {Gengshan Yang and Minh Vo and Natalia Neverova and Deva Ramanan and Andrea Vedaldi and Hanbyul Joo},
journal= {arXiv preprint arXiv:2112.12761},
year = {2023}
}
备注
CVPR 2022 camera-ready version (last update: May 2022)