模仿任意说话风格实现逼真的音频驱动说话人脸合成
计算机视觉与模式识别
2021-11-02 v1 图形学
多媒体
摘要
人们以多样化的风格说话。对于同一段语音,不同的说话风格在面部和头部姿态运动上表现出显著差异。例如,“兴奋”风格通常张嘴幅度大,而“庄重”风格更规范且很少出现夸张动作。由于不同风格间存在巨大差异,有必要将说话风格融入音频驱动的说话人脸合成框架中。本文中,我们提出通过模仿特定参考视频的任意说话风格,将风格注入说话人脸合成框架。具体而言,我们利用所收集的 Ted-HD 数据集对说话风格进行系统研究,并构建风格编码作为三维可变形模型(3DMM)参数的若干统计量。随后,我们设计了一种潜风格融合(LSF)模型,通过模仿风格编码中的说话风格来合成风格化说话人脸。我们强调框架的以下新颖特性:(1)不需要任何风格标注,说话风格以无监督方式从野外说话视频中学习。(2)可以模仿任意视频的任意风格,且风格编码也可插值以生成新风格。大量实验表明,与基线方法相比,所提框架能够合成更自然且更具表现力的说话风格。
引用
@article{arxiv.2111.00203,
title = {Imitating Arbitrary Talking Style for Realistic Audio-DrivenTalking Face Synthesis},
author = {Haozhe Wu and Jia Jia and Haoyu Wang and Yishun Dou and Chao Duan and Qingshan Deng},
journal= {arXiv preprint arXiv:2111.00203},
year = {2021}
}
备注
Accepted by MM2021, code available at https://github.com/wuhaozhe/style_avatar