基于联合不确定性学习的语音驱动说话人面部视频生成
计算机视觉与模式识别
2025-04-29 v1 人工智能
摘要
语音驱动的说话人面部视频生成面临巨大挑战。先前研究强调音频-唇形同步和视觉质量的重要性。目前,针对视觉不确定性学习的关注有限,导致现有系统存在视觉质量不一致和不同输入条件下性能不可靠等问题。为此,我们提出一种联合不确定性学习网络(JULNet),实现高质量说话人面部视频生成, incorporates 一种直接关联视觉误差的不确定性表示。具体而言,我们首先设计不确定性模块,单独预测生成图像与真实图像之间的误差图和不确定性图。误差图代表生成图像与真实图像之间的差异,而不确定性图用于预测错误估计的概率。此外,为将不确定性分布匹配到误差分布,我们引入直方图技术来近似分布。通过联合优化误差和不确定性,可增强模型的性能和鲁棒性。大量实验表明,我们的方法在说话人面部视频生成中在高保真度和音频-唇形同步方面优于先前方法。
引用
@article{arxiv.2504.18810,
title = {Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning},
author = {Yifan Xie and Fei Ma and Yi Bin and Ying He and Fei Yu},
journal= {arXiv preprint arXiv:2504.18810},
year = {2025}
}
备注
10 pages, 7 figures