中文

基于语义感知先验的可控单样本人脸视频合成

计算机视觉与模式识别 2023-05-01 v1 人工智能

摘要

单样本说话头部合成任务旨在将源图像动画化为由驱动帧指定的另一姿态与表情。近期方法依赖于以无监督方式学习的稀疏关键点估计运动场,对从源提取的外观特征进行扭曲。由于其轻量设计,它们适用于降低带宽的视频会议。然而,基于我们的研究,当前方法存在两个主要局限:1)在大幅头部姿态下生成质量不佳,且源图像与驱动视频首帧间存在可观测的姿态错位。2)由于缺乏语义理解与恰当的面部几何正则化,无法捕捉精细却关键的面部运动细节。为解决这些不足,我们提出一种利用丰富人脸先验信息的新方法,所提模型在同等带宽下可生成具有改善语义一致性(平均关键点距离较基线提升 7%)与表情保持(平均情感嵌入距离优于基线 15%)的人脸视频。此外,融入此类先验信息为我们提供了便捷接口,以实现姿态与表情高度可控的生成。

关键词

引用

@article{arxiv.2304.14471,
  title  = {Controllable One-Shot Face Video Synthesis With Semantic Aware Prior},
  author = {Kangning Liu and Yu-Chuan Su and Wei and Hong and Ruijin Cang and Xuhui Jia},
  journal= {arXiv preprint arXiv:2304.14471},
  year   = {2023}
}