Imaginary Voice:面向文本转语音的面部风格扩散模型
机器学习
2023-02-28 v1 计算机视觉与模式识别
声音
音频与语音处理
摘要
本工作的目标是零样本文本转语音合成,其说话风格和声音从面部特征中学习。受人们看到他人面孔便能想象其声音这一自然事实的启发,我们引入了一种在统一框架中从可见属性学习的面部风格扩散文本转语音(TTS)模型,称为 Face-TTS。这是首次将人脸图像用作条件来训练 TTS 模型。我们联合训练跨模态生物特征与 TTS 模型,以在人脸图像与生成语音段之间保持说话人身份。我们还提出了说话人特征绑定损失,以在说话人嵌入空间中强制生成语音与真实语音段的相似性。由于生物信息直接从人脸图像提取,我们的方法无需额外微调步骤即可从未见且未闻的说话人生成语音。我们在 LRS3 数据集(一个包含背景噪声和多样说话风格的真实场景音视频语料库)上训练和评估模型。项目页面为 https://facetts.github.io。
引用
@article{arxiv.2302.13700,
title = {Imaginary Voice: Face-styled Diffusion Model for Text-to-Speech},
author = {Jiyoung Lee and Joon Son Chung and Soo-Whan Chung},
journal= {arXiv preprint arXiv:2302.13700},
year = {2023}
}
备注
ICASSP 2023. Project page: https://facetts.github.io