中文

PC-Talk: 音频驱动说话人脸生成的精确面部动画控制

计算机视觉与模式识别 2025-03-21 v2 人工智能

摘要

音频驱动说话人脸生成方面的最新进展在唇同步方面取得了巨大进步。然而,当前方法通常对面部动画(如说话风格和情感表达)缺乏足够的控制,导致输出结果单一。在本文中,我们聚焦于改善两个关键因素:唇-音频对齐和情感控制,以增强说话视频的多样性和用户友好性。唇-音频对齐控制关注说话风格和唇部运动幅度等元素,而情感控制则侧重于生成逼真的情感表达,允许对多个属性(如强度)进行修改。为实现对面部动画的精确控制,我们提出了一种新颖框架 PC-Talk,它通过隐式关键点变形实现唇-音频对齐和情感控制。首先,我们的唇-音频对齐控制模块支持在词级精确编辑说话风格,并调整唇部运动幅度以模拟不同的音量水平,同时保持与音频的唇同步。其次,我们的情感控制模块通过纯情感变形生成生动的情感面部特征。该模块还支持对不同面部区域中情感强度和多种情感组合的精细修改。在广泛实验中,我们的方法展现出卓越的控制能力,并在 HDTF 和 MEAD 数据集上取得了最先进的性能。

关键词

引用

@article{arxiv.2503.14295,
  title  = {PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generation},
  author = {Baiqin Wang and Xiangyu Zhu and Fan Shen and Hao Xu and Zhen Lei},
  journal= {arXiv preprint arXiv:2503.14295},
  year   = {2025}
}