中文

基于音频的 3D 深度感知说话人脸视频编辑

计算机视觉与模式识别 2025-01-06 v1

摘要

尽管在说话人脸视频生成研究方面取得了显著进展,但在基于输入音频编辑嘴型时,精确的嘴音同步和高视觉质量仍然具有挑战性。本文介绍了 JoyGen,一个新的两阶段框架用于说话人脸生成,包括音频驱动的嘴型运动生成和视觉外观合成。在第一阶段,一个 3D 重建模型和一个 audio2motion 模型分别预测身份系数和表情系数。接下来,通过将音频特征与面部深度图集成,我们为面部生成提供了全面的监督,以实现精确的嘴音同步。此外,我们构建了一个包含 130 小时高质量视频的中文说话人脸数据集。JoyGen 在开源的 HDTF 数据集和我们精选的数据集上进行训练。实验结果表明,我们的方法在嘴音同步和视觉质量方面实现了优异的性能。

关键词

引用

@article{arxiv.2501.01798,
  title  = {JoyGen: Audio-Driven 3D Depth-Aware Talking-Face Video Editing},
  author = {Qili Wang and Dajiang Wu and Zihang Xu and Junshi Huang and Jun Lv},
  journal= {arXiv preprint arXiv:2501.01798},
  year   = {2025}
}