中文

GHuNeRF:基于单目视频的可泛化人体 NeRF

计算机视觉与模式识别 2023-12-13 v3

摘要

本文致力于从单目视频中学习可泛化的人体 NeRF 模型这一挑战性任务。尽管现有可泛化人体 NeRF 已取得令人印象深刻的成果,但它们需要多视角图像或视频,而这类数据未必总可获得。另一方面,一些从单目视频进行人体自由视角渲染的工作无法泛化到未见身份。鉴于这些局限,我们提出 GHuNeRF,从人体表演者的单目视频中学习可泛化的人体 NeRF 模型。我们首先引入可见性感知聚合方案计算顶点级特征,用于构建 3D 特征体。由于分辨率有限,该特征体只能以不足精度表示人体表演者的整体几何。为解决此问题,我们进一步利用注意力机制以时间对齐的点级特征增强体特征。最后,增强后的特征用于预测每个采样点的密度与颜色。我们还采用表面引导采样策略以提升训练与推理效率。我们在广泛使用的 ZJU-MoCap 数据集上验证方法,取得了与现有基于多视角视频方法相当的性能。我们还在单目 People-Snapshot 数据集上测试,在仅使用单目视频时优于现有工作。我们的代码见于项目网站。

关键词

引用

@article{arxiv.2308.16576,
  title  = {GHuNeRF: Generalizable Human NeRF from a Monocular Video},
  author = {Chen Li and Jiahao Lin and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2308.16576},
  year   = {2023}
}

备注

Add in more baseline for comparison