FONT: 基于流引导的一次性说话头生成与自然头部运动
计算机视觉与模式识别
2023-04-03 v1
摘要
近年来,一次性说话头生成受到越来越多的关注,具有各种创意和实际应用。理想的自然生动的生成说话头视频应包含自然的头部姿态变化。然而,由于音视频模态间存在天然鸿沟,从驱动音频映射头部姿态序列具有挑战性。本工作中,我们提出一种流引导一次性模型,在生成的说话头上实现自然头部运动(FONT)。具体而言,设计头部姿态预测模块从源人脸和驱动音频生成头部姿态序列。我们加入随机采样操作和结构相似性约束来建模音视频模态间一对多映射的多样性,从而预测自然头部姿态。随后我们开发关键点预测器,从源人脸、驱动音频和姿态序列产生无监督关键点以描述面部结构信息。最后,采用流引导遮挡感知生成器从估计关键点和源人脸生成照片级真实说话头视频。大量实验结果证明,FONT生成具有自然头部姿态和同步嘴形的说话头,优于其他对比方法。
引用
@article{arxiv.2303.17789,
title = {FONT: Flow-guided One-shot Talking Head Generation with Natural Head Motions},
author = {Jin Liu and Xi Wang and Xiaomeng Fu and Yesheng Chai and Cai Yu and Jiao Dai and Jizhong Han},
journal= {arXiv preprint arXiv:2303.17789},
year = {2023}
}
备注
Accepted by ICME2023