中文

探究在多方言多风格语音合成中融合预训练与可学习说话人表征

音频与语音处理 2021-05-04 v5 机器学习 声音

摘要

少样本多方言多风格语音克隆任务旨在仅给定少量参考样本的情况下,合成与参考说话人音色的语音和说话风格相似的语句。在本工作中,我们研究了不同的说话人表征,并提出融合预训练与可学习的说话人表征。在不同类型的嵌入中,通过语音转换预训练的嵌入取得了最佳性能。结合预训练与可学习说话人表征的 FastSpeech 2 模型在少样本说话人上展现出很强的泛化能力,并在 ICASSP 2021 M2VoC 挑战赛的单样本赛道中获得第二名。

关键词

引用

@article{arxiv.2103.04088,
  title  = {Investigating on Incorporating Pretrained and Learnable Speaker Representations for Multi-Speaker Multi-Style Text-to-Speech},
  author = {Chung-Ming Chien and Jheng-Hao Lin and Chien-yu Huang and Po-chun Hsu and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2103.04088},
  year   = {2021}
}

备注

Accepted by ICASSP 2021, in the special session of ICASSP 2021 M2VoC Challenge