MakeItTalk:说话人感知的说话头动画生成
计算机视觉与模式识别
2021-02-26 v3 图形学
摘要
我们提出了一种以单张人脸图像和音频为唯一输入来生成富有表现力的说话头的方法。与以往试图学习从音频到原始像素或点以创建说话人脸的直接映射的方法不同,我们的方法首先解耦输入音频信号中的内容与说话人信息。音频内容稳健地控制嘴唇及附近面部区域的运动,而说话人信息决定面部表情的细节以及说话头动态的其余部分。我们方法的另一个关键组件是预测反映说话人感知动态的面部标志点。基于这一中间表示,我们的方法能够合成具有完整运动范围的照片级真实感整个说话头视频,并能在单一统一框架中动画化艺术绘画、素描、2D卡通角色、日本漫画、风格化漫画像。我们给出了方法的广泛定量与定性评估以及用户研究,表明所生成的说话头质量显著高于先前的最先进技术(SOTA)。
引用
@article{arxiv.2004.12992,
title = {MakeItTalk: Speaker-Aware Talking-Head Animation},
author = {Yang Zhou and Xintong Han and Eli Shechtman and Jose Echevarria and Evangelos Kalogerakis and Dingzeyu Li},
journal= {arXiv preprint arXiv:2004.12992},
year = {2021}
}
备注
SIGGRAPH Asia 2020, 15 pages, 13 figures