中文

现实为画布,语言作画笔:从单目视频构建3D化身

计算机视觉与模式识别 2024-03-26 v2

摘要

近期3D化身生成的进展在多视图监督下能出色地生成逼真模型。然而,单目方法尽管适用性更广,但在质量上有所滞后。我们提出ReCaLaB来弥合这一差距。ReCaLaB是一个完全可微的流程,仅从单个RGB视频学习高保真3D人体化身。一个姿态条件的可变形NeRF被优化,以体积方式表示处于规范T姿态的人体对象。然后利用该规范表示,通过2D-3D对应关系高效关联神经纹理。这使得能够分离漫反射颜色生成和光照校正分支,共同合成RGB预测。该设计允许通过文本提示控制人体姿态、体型、纹理和光照的中间结果。图像条件的扩散模型从而帮助动画化3D化身的姿态和外观,以创建包含前所未见人体运动的视频序列。大量实验表明,ReCaLaB在图像合成任务的图像质量方面优于以往的单目方法。此外,自然语言为3D人体化身的创造性操控提供了直观的用户界面。

关键词

引用

@article{arxiv.2312.04784,
  title  = {Reality's Canvas, Language's Brush: Crafting 3D Avatars from Monocular Video},
  author = {Yuchen Rao and Eduardo Perez Pellitero and Benjamin Busam and Yiren Zhou and Jifei Song},
  journal= {arXiv preprint arXiv:2312.04784},
  year   = {2024}
}

备注

Video link: https://youtu.be/Oz83z1es2J4