中文

RealTalk:基于 3D 面部先验引导的身份对齐网络实现音频驱动面部生成的实时与真实性

计算机视觉与模式识别 2024-08-09 v2

摘要

人通用音频驱动面部生成是计算机视觉中的一个具有挑战性的任务。以往方法在音频-视觉同步方面取得了显著进展,但与实际应用之间仍存在显著差距。挑战主要体现在两方面:1)保持独特的个人特征,以实现高精度的lip同步;2)实现实时性能下的高质量面部渲染。在本文中,我们提出了一种新型通用音频驱动框架RealTalk,包含音频到表情转换器和高保真度表情到面部渲染器。对于第一个组件,我们同时考虑与说话 lip 动作相关的身份特征和个体内变动特征。通过在丰富的面部先验上融合跨模态注意力机制,我们能够有效地将 lip 动作与音频对齐,从而实现更精确的表情预测。在第二个组件中,我们设计了轻量级的面部身份对齐(FIA)模块,包括 lip 形状控制结构和面部纹理参考结构。这种新颖的设计使我们能够在不依赖复杂且低效特征对齐模块的情况下实现实时细节生成。我们的实验结果,包括定量和定性分析,表明该方法在 lip-语音同步和生成质量方面具有明显优势。此外,该方法高效且所需计算资源更少,适合满足实际应用的需求。

关键词

引用

@article{arxiv.2406.18284,
  title  = {RealTalk: Real-time and Realistic Audio-driven Face Generation with 3D Facial Prior-guided Identity Alignment Network},
  author = {Xiaozhong Ji and Chuming Lin and Zhonggan Ding and Ying Tai and Junwei Zhu and Xiaobin Hu and Donghao Luo and Yanhao Ge and Chengjie Wang},
  journal= {arXiv preprint arXiv:2406.18284},
  year   = {2024}
}