中文

FluentLip:基于音素的两阶段音频驱动唇部合成方法,具有光流一致性

计算机视觉与模式识别 2025-04-08 v1 人工智能 人机交互

摘要

生成与给定语音对齐的连续唇部运动图像是一项具有挑战性的任务。尽管先前的研究在同步性和视觉质量方面取得了进展,但唇部可读性和视频流畅性仍然是持续的挑战。本文提出FluentLip,一种两阶段音频驱动唇部合成方法,包含三种特色策略。为了提高唇部同步性和可读性,我们集成了音素提取器和编码器,生成音频和音素信息的融合用于多模态学习。此外,我们采用光流一致性损失来确保图像帧之间的自然过渡。此外,我们在生成对抗网络(GANs)训练过程中引入扩散链以提高稳定性和效率。我们通过大量实验评估了所提出的FluentLip,将其与五种最先进(SOTA)方法在五个指标上进行比较,包括一个提出的指标——音素错误率(PER),用于评估唇部姿态可读性和视频流畅性。实验结果表明,我们的FluentLip方法具有很强的竞争力,在平滑性和自然性方面取得了显著改进。特别是,它在Fréchet Inception Distance(FID)上比这些SOTA方法提高了约16.3%,在PER上提高了35.2%。

关键词

引用

@article{arxiv.2504.04427,
  title  = {FluentLip: A Phonemes-Based Two-stage Approach for Audio-Driven Lip Synthesis with Optical Flow Consistency},
  author = {Shiyan Liu and Rui Qu and Yan Jin},
  journal= {arXiv preprint arXiv:2504.04427},
  year   = {2025}
}