中文

SyncTalk++: 用于高保真率且高效同步说话人头肖像合成的高斯溅写方法

计算机视觉与模式识别 2025-06-18 v1

摘要

在合成逼真的、语音驱动的说话人视频时实现高同步性是一个具有重要挑战性的任务。逼真的说话人头肖像需要主体身份、唇部动作、面部表情和头部姿态实现同步协调。缺乏这些同步性是导致不真实结果的根本性缺陷。为解决创建逼真说话人头肖像中同步性这一关键问题——被称为"恶魔"——我们引入SyncTalk++,其包含用于确保主体身份一致性保存的高斯溅写动态肖像渲染器,以及用于将唇部动作与语音对齐的面部同步控制器。我们创新性地使用3D面部混合形状模型来重建准确的面部表情。为确保自然的头部运动,我们提出了头部同步稳定器,以实现更稳定的头部姿态优化。此外,SyncTalk++通过引入表情生成器和躯干恢复器来增强对分布外(OOD)音频的鲁棒性,这些组件会生成与语音匹配的面部表情和无缝的躯干区域。我们的方法在帧之间保持视觉细节的一致性和连续性,显著提高了渲染速度和质量,实现最高可达101帧/秒。大量实验和用户研究表明,SyncTalk++在同步性和逼真性方面优于当前最先进的方法。我们建议观看补充视频:https://ziqiaopeng.github.io/synctalk++。

关键词

引用

@article{arxiv.2506.14742,
  title  = {SyncTalk++: High-Fidelity and Efficient Synchronized Talking Heads Synthesis Using Gaussian Splatting},
  author = {Ziqiao Peng and Wentao Hu and Junyuan Ma and Xiangyu Zhu and Xiaomei Zhang and Hao Zhao and Hui Tian and Jun He and Hongyan Liu and Zhaoxin Fan},
  journal= {arXiv preprint arXiv:2506.14742},
  year   = {2025}
}