中文

SyncDiff:基于瓶颈化时间视觉先验的扩散模型说话头合成

机器学习 2025-03-18 v1

摘要

说话头合成,也称为语音到唇部合成,重建与给定音频轨道相匹配的面部动作。对合成视频的评估主要基于两个方面:唇语同步性和图像保真度。近期研究表明,基于GAN的模型和基于扩散的模型在该任务上均取得了最先进(SOTA)性能,其中扩散模型在图像保真度方面表现优越,但在同步性方面不及其GAN-based对手。为此,我们提出SyncDiff,一种一种有效的方法,通过融入带信息瓶颈的时间姿态帧和从AVHuBERT中提取的面部信息丰富的音频特征,作为扩散过程的条件输入,以提高基于扩散的方法的同步性能。我们在两个标准说话头数据集上进行评估,即LRS2和LRS3,以与其他SOTA模型进行直接比较。在LRS2/LRS3数据集上的实验表明,SyncDiff相对于以往基于扩散的方法,在同步得分上提高了27.7%/62.3%,同时保持了其高保真度特征。

关键词

引用

@article{arxiv.2503.13371,
  title  = {SyncDiff: Diffusion-based Talking Head Synthesis with Bottlenecked Temporal Visual Prior for Improved Synchronization},
  author = {Xulin Fan and Heting Gao and Ziyi Chen and Peng Chang and Mei Han and Mark Hasegawa-Johnson},
  journal= {arXiv preprint arXiv:2503.13371},
  year   = {2025}
}

备注

Accepted to WACV 2025