EmoGene:面向情感表达的音频驱动情绪3D说话人生成
计算机视觉与模式识别
2025-05-05 v2 人工智能
人机交互
机器学习
摘要
音频驱动的说话人生成是虚拟人交互和电影制作中至关重要且有用的技术。虽然近期研究聚焦于提高图像保真度和唇部同步,但生成准确的情感表达仍未得到充分探索。本文介绍EmoGene,一种用于合成高保真度、音频驱动视频肖像并准确表达情感的新型框架。我们采用基于变分自编码器(VAE)的音频到运动模块生成面部关键点,将其与情感嵌入在运动到情感模块中连接,以产生情感关键点。这些关键点驱动基于神经辐射场(NeRF)的情感到视频模块生成逼真的情感说话人视频。此外,我们提出一种姿态采样方法,用于生成静音音频输入的自然非说话状态视频。广泛的实验表明,EmoGene 在生成高保真度情感说话人视频方面优于先前方法。
引用
@article{arxiv.2410.17262,
title = {EmoGene: Audio-Driven Emotional 3D Talking-Head Generation},
author = {Wenqing Wang and Yun Fu},
journal= {arXiv preprint arXiv:2410.17262},
year = {2025}
}
备注
Accepted by the 2025 IEEE 19th International Conference on Automatic Face and Gesture Recognition (FG)