中文

高效听者:基于动作扩散的双方面面部运动合成

计算机视觉与模式识别 2025-04-30 v1 人机交互

摘要

生成真实的听者面部运动在双方面对话中具有挑战性,由于高维动作空间和时序依赖性要求。现有方法通常考虑提取3D可形状模型(3DMM)系数并在3DMM空间中建模。然而,这会使3DMM的计算速度成为瓶颈,难以实现实时交互式响应。为解决此问题,本文提出面部动作扩散(FAD),引入图像生成领域的扩散方法以实现高效面部动作生成。我们进一步构建高效听者网络(ELNet),专为兼容说话者的视觉和音频信息而设计。结合FAD和ELNet,该方法学习有效的听者面部运动表示,并在减少99%计算时间的同时超越当前最先进的方法实现性能提升。

关键词

引用

@article{arxiv.2504.20685,
  title  = {Efficient Listener: Dyadic Facial Motion Synthesis via Action Diffusion},
  author = {Zesheng Wang and Alexandre Bruckert and Patrick Le Callet and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2504.20685},
  year   = {2025}
}