StyleTalker:基于风格的一次性音频驱动说话头视频生成
计算机视觉与模式识别
2024-03-18 v2 机器学习
音频与语音处理
图像与视频处理
摘要
我们提出 StyleTalker,一种新颖的音频驱动说话头生成模型,可从单张参考图像合成说话人物的视频,具有与音频精确同步的唇形、真实的头部姿态与眨眼。具体而言,通过利用预训练的图像生成器与图像编码器,我们估计说话头视频的潜在码,忠实反映给定音频。这得益于几个新设计的组件得以实现:1)用于精确唇形同步的对比唇形同步判别器;2)条件时序变分自编码器,学习从唇部运动中解耦的潜在运动空间,从而可在保持身份的同时独立操控运动与唇部运动;3)结合归一化流的自回归先验,用于学习复杂的音频到运动多模态潜在空间。配备这些组件后,StyleTalker 不仅可在给定另一运动源视频时以运动可控方式生成说话头视频,还可通过从输入音频推断真实运动以完全音频驱动的方式生成。通过大量实验与用户研究,我们表明我们的模型能够合成具有令人印象深刻的感知质量的说话头视频,且与输入音频精确唇形同步,大幅优于最先进的基线方法。
引用
@article{arxiv.2208.10922,
title = {StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation},
author = {Dongchan Min and Minyoung Song and Eunji Ko and Sung Ju Hwang},
journal= {arXiv preprint arXiv:2208.10922},
year = {2024}
}