实时语音肖像:基于音频的实时照片级真实感说话头部动画
图形学
2021-09-27 v2 计算机视觉与模式识别
摘要
据我们所知,我们首次提出了一个实时系统,仅由音频信号驱动,以超过 30 fps 的帧率生成个性化的照片级真实感说话头部动画。我们的系统包含三个阶段。第一阶段是一个深度神经网络,提取深度音频特征,并通过流形投影将特征投影到目标人物的语音空间。在第二阶段,我们从投影后的音频特征中学习面部动态与运动。预测的运动包括头部姿态和上身运动,其中前者由一个自回归概率模型生成,该模型对目标人物的头部姿态分布进行建模。上身运动由头部姿态推导得出。在最后阶段,我们根据先前的预测生成条件特征图,并将其与候选图像集一起送入图像到图像翻译网络以合成照片级真实感渲染结果。我们的方法对野生音频泛化良好,并成功合成高保真度的个性化面部细节,例如皱纹、牙齿。我们的方法还允许对头部姿态进行显式控制。大量的定性、定量评估以及用户研究证明了我们的方法相对于最先进技术的优越性。
引用
@article{arxiv.2109.10595,
title = {Live Speech Portraits: Real-Time Photorealistic Talking-Head Animation},
author = {Yuanxun Lu and Jinxiang Chai and Xun Cao},
journal= {arXiv preprint arXiv:2109.10595},
year = {2021}
}
备注
SIGGRAPH Asia 2021, 17 pages, 16 figures