中文

OPT:一次性姿态可控说话头生成

计算机视觉与模式识别 2023-02-17 v1

摘要

一次性说话头生成基于任意音频与单张源人脸生成唇形同步的说话头。为保证自然性与真实感,近期方法提出实现自由姿态控制而非简单地编辑嘴部区域。然而,现有方法在生成头部运动时未能保持源人脸的准确身份。为解决身份不匹配问题并实现高质量自由姿态控制,我们提出一次性姿态可控说话头生成网络(OPT)。具体而言,音频特征解耦模块从音频中分离内容特征,消除任意驱动音频中所含说话人特定信息的影响。随后,从内容特征与源人脸提取嘴部表情特征,其间设计 landmark 损失以增强面部结构与身份保持质量。最后,为实现自由姿态控制,来自参考视频的可控头部姿态特征与表情特征及源人脸一同送入视频生成器以生成新说话头。大量定量与定性实验结果验证,OPT生成高质量无身份不匹配问题的姿态可控说话头,优于先前SOTA方法。

关键词

引用

@article{arxiv.2302.08197,
  title  = {OPT: One-shot Pose-Controllable Talking Head Generation},
  author = {Jin Liu and Xi Wang and Xiaomeng Fu and Yesheng Chai and Cai Yu and Jiao Dai and Jizhong Han},
  journal= {arXiv preprint arXiv:2302.08197},
  year   = {2023}
}

备注

Accepted by ICASSP2023