VASA-1:实时生成逼真的音频驱动说话人脸
计算机视觉与模式识别
2024-11-01 v2
摘要
我们介绍 VASA,这是一个基于单张静态图像和语音音频片段生成逼真说话人脸的框架。我们的首要模型 VASA-1 能够不仅生成与音频高度同步的唇部动作,还产生大范围的面部细微变化和自然头部动作,增强真实感和活力感。核心创新包括面部动态和头部运动生成模型(工作于面部潜空间中),以及开发高度表达且解耦的面部潜空间。通过大量实验(包括新评估指标),我们证明该方法在多个维度上显著优于先前方法。该方法不仅提供高质量的视频,具有真实的面部和头部动态,还支持以最高 40 FPS 的速度在线生成 512x512 分辨率的视频,启动延迟极低。这为与具备人类对话行为的逼真化身进行实时互动铺平了道路。
引用
@article{arxiv.2404.10667,
title = {VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time},
author = {Sicheng Xu and Guojun Chen and Yu-Xiao Guo and Jiaolong Yang and Chong Li and Zhenyu Zang and Yizhong Zhang and Xin Tong and Baining Guo},
journal= {arXiv preprint arXiv:2404.10667},
year = {2024}
}
备注
NeurIPS 2024 (Oral) Camera ready. Project webpage: https://www.microsoft.com/en-us/research/project/vasa-1/