中文

基于人脸图像的残差引导个性化语音合成

声音 2022-04-05 v1 计算机视觉与模式识别 音频与语音处理

摘要

先前的工作通过在由某人自己的音频声音组成的大型数据集上训练模型来提取个性化语音特征。已有报道表明人脸信息与语音声音有强关联。因此,在本工作中,我们创新性地从人脸中提取个性化语音特征,并利用神经声码器合成个性化语音。我们设计了一个包含语音编码器、语音合成器和人脸编码器的基于人脸的残差个性化语音合成模型(FR-PSS)用于 PSS。在该模型中,通过设计两个语音先验,引入了残差引导策略以在训练中引导人脸特征逼近真实语音特征。此外,考虑到特征绝对值的误差及其方向偏差,我们为人脸编码器制定了一种新颖的三项损失函数。实验结果表明,我们的模型合成的语音可与先前工作中通过训练大量音频数据合成的个性化语音相媲美。

关键词

引用

@article{arxiv.2204.01672,
  title  = {Residual-guided Personalized Speech Synthesis based on Face Image},
  author = {Jianrong Wang and Zixuan Wang and Xiaosheng Hu and Xuewei Li and Qiang Fang and Li Liu},
  journal= {arXiv preprint arXiv:2204.01672},
  year   = {2022}
}

备注

ICASSP 2022