中文

DEGSTalk:面向留发发声人物合成的分解式嵌入高斯场

计算机视觉与模式识别 2024-12-31 v1 人机交互

摘要

准确合成说话人面部视频并捕捉拥有长发个体的面部细微特征 presents a significant challenge。为解决现有方法中的这些挑战,本文提出了分解式嵌入高斯场(DEGSTalk),一种基于3D高斯溅写(3DGS)的说话人面部合成方法,用于生成具有长发的真实说话人面部。DEGSTalk采用可变形预嵌入高斯场,通过隐式表达系数动态调整预嵌入高斯原始块,从而实现对动态面部区域和细微表情的精准捕捉。此外,本文提出了动态保持人物轮廓的渲染技术,以增强合成视频中长发运动的真实性。结果表明,DEGSTalk在处理复杂面部动态和保持发丝方面,优于现有方法,实现了 improved realism 和合成质量。我们的代码将在 https://github.com/CVI-SZU/DEGSTalk 公开。

关键词

引用

@article{arxiv.2412.20148,
  title  = {DEGSTalk: Decomposed Per-Embedding Gaussian Fields for Hair-Preserving Talking Face Synthesis},
  author = {Kaijun Deng and Dezhi Zheng and Jindong Xie and Jinbao Wang and Weicheng Xie and Linlin Shen and Siyang Song},
  journal= {arXiv preprint arXiv:2412.20148},
  year   = {2024}
}

备注

Accepted by ICASSP 2025