中文

OTAvatar:基于可控三平面渲染的一次性说话人脸头像

计算机视觉与模式识别 2023-03-28 v1 人工智能

摘要

可控性、泛化性和效率是构建以神经隐式场表示的面部头像的主要目标。然而,现有方法未能同时兼顾这三项要求。它们要么聚焦于静态肖像,将表示能力限制于特定对象,要么承受巨大的计算成本,限制了其灵活性。本文提出一次性说话人脸头像(OTAvatar),通过一种泛化可控的三平面渲染方案构建人脸头像,使得每个个性化头像仅需以一张肖像作为参考即可构建。具体而言,OTAvatar 首先将一张肖像图像反演为无运动的身份码。其次,利用身份码与运动码调制一个高效的 CNN 以生成编码所需运动下该对象的三平面形式体积。最后,采用体渲染生成任意视角下的图像。我们方案的核心是一种新颖的“反演解耦”策略,通过基于优化的反演在潜码中分离身份与运动。得益于高效的三平面表示,我们在 A100 上以 3535 FPS 实现泛化人脸头像的可控渲染。实验展示了在训练集外对象上跨身份重演的良好性能以及更好的 3D 一致性。

关键词

引用

@article{arxiv.2303.14662,
  title  = {OTAvatar: One-shot Talking Face Avatar with Controllable Tri-plane Rendering},
  author = {Zhiyuan Ma and Xiangyu Zhu and Guojun Qi and Zhen Lei and Lei Zhang},
  journal= {arXiv preprint arXiv:2303.14662},
  year   = {2023}
}

备注

Accepted by CVPR 2023. The code is available at https://github.com/theEricMa/OTAvatar