一种基于关键点的音频驱动自由视角说话头合成增强方法
计算机视觉与模式识别
2022-10-10 v1
摘要
音频驱动说话头合成是近年来备受关注的一项具有挑战性的任务。尽管现有基于二维 landmarks 或三维人脸模型的方法能够为任意身份合成准确的唇形同步与有节奏的头部姿态,但它们仍存在局限,例如嘴部映射中的割裂感以及皮肤高光的缺失。与周围面部相比,变形区域较为模糊。本文提出一种基于关键点增强(KPBE)的方法用于音频驱动自由视角说话头合成,以提升生成视频的自然度。首先,使用现有方法作为后端合成中间结果。随后,我们利用关键点分解从后端输出与源图像中提取视频合成控制参数。之后,将这些控制参数合成到源关键点与驱动关键点中。采用基于运动场的方法从关键点表示生成最终图像。借助关键点表示,我们克服了嘴部映射中的割裂感与皮肤高光的缺失。实验表明,我们所提出的增强方法在平均意见得分方面提升了说话头视频的质量。
引用
@article{arxiv.2210.03335,
title = {A Keypoint Based Enhancement Method for Audio Driven Free View Talking Head Synthesis},
author = {Yichen Han and Ya Li and Yingming Gao and Jinlong Xue and Songpo Wang and Lei Yang},
journal= {arXiv preprint arXiv:2210.03335},
year = {2022}
}