基于 3D 骨架正则化与富有表现力身体姿态的语音到视频合成
计算机视觉与模式识别
2020-10-12 v5 机器学习
音频与语音处理
摘要
本文中,我们提出一种新方法,将给定语音音频转换为特定人物的照片级真实感说话视频,其中输出视频具有同步、真实且富有表现力的丰富身体动态。我们首先使用循环神经网络 (RNN) 从音频序列生成 3D 骨架运动,然后通过条件生成对抗网络 (GAN) 合成输出视频。为使骨架运动真实且富有表现力,我们在学习与测试流程的生成过程中,嵌入了关节化 3D 人体骨架的知识以及学习到的个人语音象征性手势字典。前者防止生成不合理的身体扭曲,后者帮助我们的模型通过少量录制视频快速学习有意义的身体运动。为生成具运动细节的照片级真实感高分辨率视频,我们提出在条件 GAN 中插入部位注意力机制,其中每个细节部位(如头部和手)被自动放大以拥有其自身的判别器。为验证我们的方法,我们收集了一个数据集,包含 1 名男性和 1 名女性模特在不同主题下阅读各类文档的 20 个高质量视频。与处理类似任务的先前 SoTA 流程相比,我们的方法通过用户研究取得了更好的结果。
引用
@article{arxiv.2007.09198,
title = {Speech2Video Synthesis with 3D Skeleton Regularization and Expressive Body Poses},
author = {Miao Liao and Sibo Zhang and Peng Wang and Hao Zhu and Xinxin Zuo and Ruigang Yang},
journal= {arXiv preprint arXiv:2007.09198},
year = {2020}
}
备注
Accepted by ACCV 2020