Text2Video:基于个性化音素-姿态字典的文本驱动说话头视频合成
计算机视觉与模式识别
2022-01-25 v3 图像与视频处理
摘要
随着深度学习技术的进步,从音频或文本自动生成视频已成为一个新兴且有前景的研究课题。本文提出一种从文本合成视频的新方法。该方法构建音素-姿态字典并训练生成对抗网络 (GAN) 以从插值音素姿态生成视频。与音频驱动的视频生成算法相比,我们的方法具有若干优势:1) 仅需音频驱动方法所用训练数据的一小部分;2) 更灵活且不受说话人变化导致的脆弱性影响;3) 显著减少预处理、训练与推理时间。我们进行了大量实验,在基准数据集及我们自建数据集上将所提方法与最先进的说话脸生成方法比较。结果证明了我们方法的有效性与优越性。
引用
@article{arxiv.2104.14631,
title = {Text2Video: Text-driven Talking-head Video Synthesis with Personalized Phoneme-Pose Dictionary},
author = {Sibo Zhang and Jiahong Yuan and Miao Liao and Liangjun Zhang},
journal= {arXiv preprint arXiv:2104.14631},
year = {2022}
}
备注
ICASSP 2022