中文

基于 AU 引导关键点预测的说话头像生成

计算机视觉与模式识别 2025-09-25 v1

摘要

我们提出了一种两阶段框架,用于音频驱动的说话头像生成,通过面部动作单元(AUs)实现细粒度的表情控制。与先前依赖情感标签或隐式 AU 条件化的方法不同,我们的模型将 AUs 显式映射到二维面部关键点,从而实现基于物理的、逐帧的表情控制。在第一阶段,变分运动生成器从音频和 AU 强度中预测时间一致的关键点序列。在第二阶段,基于扩散的合成器根据这些关键点和参考图像生成逼真的、唇同步的视频。运动与外观的分离提高了表情准确性、时间稳定性和视觉真实感。在 MEAD 数据集上的实验表明,我们的方法在多个指标上优于最先进基线,展示了显式 AU 到关键点建模在表达性说话头像生成中的有效性。

关键词

引用

@article{arxiv.2509.19749,
  title  = {Talking Head Generation via AU-Guided Landmark Prediction},
  author = {Shao-Yu Chang and Jingyi Xu and Hieu Le and Dimitris Samaras},
  journal= {arXiv preprint arXiv:2509.19749},
  year   = {2025}
}