中文

LawDNet:基于局部仿射变形的音频驱动 lip 合成增强方法

计算机视觉与模式识别 2024-09-17 v1

摘要

在逼真的化身生成领域,音频驱动的 lip 动作合成保真度至关重要,以实现真实的虚拟交互。现有方法面临两个关键挑战:由于生成 lip 姿势多样性不足导致的缺乏活力,以及由于时序一致性不足引起的明显畸形运动。为解决这些问题,我们提出了 LawDNet,这是一个通过局部仿射变形机制增强 lip 合成的新型深度学习架构。该机制通过可控的非线性变形场来建模语音输入对 lip 动作的复杂响应。这些变形场由针对深度特征图中抽象关键点的局部仿射变换组成,为网络中的特征变形提供了一种新型通用范式。此外,LawDNet 集成了双流判别器,以提高帧间连续性,并采用面部归一化技术处理姿态和场景变异。广泛的评估表明,LawDNet 在鲁健性和 lip 动作活力性能方面优于先前方法。本文所述的进展,包括方法、训练数据、源代码和预训练模型,都将向研究社区开放。

关键词

引用

@article{arxiv.2409.09326,
  title  = {LawDNet: Enhanced Audio-Driven Lip Synthesis via Local Affine Warping Deformation},
  author = {Deng Junli and Luo Yihao and Yang Xueting and Li Siyou and Wang Wei and Guo Jinyang and Shi Ping},
  journal= {arXiv preprint arXiv:2409.09326},
  year   = {2024}
}