Face-StyleSpeech:通过改进人脸到语音映射从人脸图像增强零样本语音合成
计算机视觉与模式识别
2024-12-31 v2 人工智能
计算与语言
多媒体
声音
音频与语音处理
摘要
从人脸图像生成语音对于开发能够以其独特声音交互、且不依赖预录人声的虚拟人至关重要。本文中,我们提出Face-StyleSpeech,一种零样本文本到语音(TTS)合成模型,其以人脸图像而非参考语音为条件生成自然语音。我们假设从人脸图像学习整体韵律特征是一项重大挑战。为此,我们的TTS模型融合了人脸编码器与韵律编码器。韵律编码器专门设计用于建模人脸图像未能充分捕获的语音风格特征,使人脸编码器专注于提取说话人特定特征(如音色)。实验结果表明,Face-StyleSpeech相比基线能从人脸图像更有效地生成更自然的语音,即便面对未见人脸亦如此。样本见我们的演示页面。
引用
@article{arxiv.2311.05844,
title = {Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping},
author = {Minki Kang and Wooseok Han and Eunho Yang},
journal= {arXiv preprint arXiv:2311.05844},
year = {2024}
}
备注
Accepted by ICASSP 2025