中文

TalkingGaussian:基于 Gaussian Splatting 的结构持久性 3D 对话头合成

计算机视觉与模式识别 2024-07-08 v2

摘要

辐射场在合成逼真的 3D 对话头方面展现了令人印象深刻的性能。然而,由于难以拟合剧烈的外观变化,通过直接修改点外观来呈现面部运动的现有范式可能会导致动态区域产生失真。为了应对这一挑战,我们引入了 TalkingGaussian,这是一个用于高保真对话头合成的基于形变的辐射场框架。利用基于点的 Gaussian Splatting,我们的方法通过对持久的高斯基元应用平滑且连续的形变来表示面部运动,而无需像以往方法那样学习困难的外观变化。由于这种简化,在保持面部特征高度完整的同时,可以合成精确的面部运动。在这种形变范式下,我们进一步发现了一种面部-嘴部运动不一致性,这会影响详细说话运动的学习。为了解决这一冲突,我们将模型分解为分别用于面部和嘴部内部区域的两个分支,从而简化学习任务,有助于重建更准确的嘴部区域的运动和结构。大量实验表明,我们的方法渲染出高质量的唇形同步对话头视频,与以往方法相比具有更好的面部保真度和更高的效率。

关键词

引用

@article{arxiv.2404.15264,
  title  = {TalkingGaussian: Structure-Persistent 3D Talking Head Synthesis via Gaussian Splatting},
  author = {Jiahe Li and Jiawei Zhang and Xiao Bai and Jin Zheng and Xin Ning and Jun Zhou and Lin Gu},
  journal= {arXiv preprint arXiv:2404.15264},
  year   = {2024}
}

备注

Accepted at ECCV 2024. Project page: https://fictionarry.github.io/TalkingGaussian/