中文

用于高质量说话头肖像合成的动态四面体学习

计算机视觉与模式识别 2024-02-28 v1

摘要

隐式表示(如神经光照场NeRF)的最新研究已推进了从视频序列生成逼真且可动画化的头部头像。然而,这些隐式方法仍面临视觉瑕疵和抖动问题,因为缺乏显式几何约束,构成了准确建模复杂面部变形的根本挑战。本文引入动态四面体(DynTet),一种新型混合表示,通过神经网络编码显式动态网格,确保在各种运动和视角下的几何一致性。DynTet通过基于坐标的网络学习符号距离、变形和材料纹理,将训练数据锚定到预定义的四面体网格中。利用三角形四面体算法,DynTet能够高效解码具有一致拓扑的纹理网格,通过可微光栅化器实现快速渲染,并通过像素损失进行监督。为提升训练效率,我们引入经典3D形状可塑模型以促进几何学习,并定义标准化空间以简化纹理学习。这些优势归功于DynTet所采用的有效几何表示。与先前方法相比,DynTet在保真度、唇部同步和实时性能方面均表现出显著提升。除了生成稳定且视觉效果良好的合成视频外,我们的方法还输出动态网格,为许多新兴应用提供了前景。

关键词

引用

@article{arxiv.2402.17364,
  title  = {Learning Dynamic Tetrahedra for High-Quality Talking Head Synthesis},
  author = {Zicheng Zhang and Ruobing Zheng and Ziwen Liu and Congying Han and Tianqi Li and Meng Wang and Tiande Guo and Jingdong Chen and Bonan Li and Ming Yang},
  journal= {arXiv preprint arXiv:2402.17364},
  year   = {2024}
}

备注

CVPR 2024