会说话的脸:从文本联合合成说话的脸部与语音
计算机视觉与模式识别
2024-05-17 v1 人工智能
声音
音频与语音处理
图像与视频处理
摘要
本工作的目标是从文本同时生成自然的说话脸部和语音输出。我们通过将说话脸部生成(TFG)和文本转语音(TTS)系统集成到一个统一框架中来实现这一目标。我们解决了每个任务的主要挑战:(1)生成代表现实场景中各种头部姿态的姿态,(2)确保面部运动变化下相同身份的语音一致性。为解决这些问题,我们引入了基于条件流匹配的运动采样器,能够以高质量且高效的方式生成运动 code。此外,我们引入了一种新的条件方法用于 TTS 系统,该方法利用来自 TFG 模型的去除运动特征,从而产生统一的语音输出。我们的广泛实验表明,我们的方法有效地创建了自然外观的说话脸部和准确匹配输入文本的语音。据我们了解,这是首个能够泛化到未见身份的多模态合成系统。
引用
@article{arxiv.2405.10272,
title = {Faces that Speak: Jointly Synthesising Talking Face and Speech from Text},
author = {Youngjoon Jang and Ji-Hoon Kim and Junseok Ahn and Doyeop Kwak and Hong-Sun Yang and Yoon-Cheol Ju and Il-Hwan Kim and Byeong-Yeol Kim and Joon Son Chung},
journal= {arXiv preprint arXiv:2405.10272},
year = {2024}
}
备注
CVPR 2024