中文

CopyCat2:一种用于多说话人语音合成与多对多细粒度韵律迁移的单模型

音频与语音处理 2022-06-28 v1 声音

摘要

在本文中,我们提出 CopyCat2(CC2),一种具备以下能力的新型模型:a)合成具有不同说话人身份的语音,b)生成富有表现力且符合上下文语境的韵律,c)在任何一对已见说话人之间以细粒度级别迁移韵律。我们通过为不同任务激活网络的不同部分来实现这一点。我们使用一种新颖的两阶段训练方法来训练模型。在第一阶段,模型从语音中学习说话人无关的词语级韵律表示,并将其用于多对多细粒度韵律迁移。在第二阶段,我们学习利用文本中可用的上下文信息来预测这些韵律表示,从而实现具有上下文恰当韵律的多说话人语音合成(TTS)。我们将 CC2 与两个强基线进行比较,一个用于具有上下文恰当韵律的 TTS,另一个用于细粒度韵律迁移。CC2 将我们的基线与复制合成语音在自然度上的差距缩小了 22.79%22.79\%。在细粒度韵律迁移评估中,其在目标说话人相似度上获得了 33.15%33.15\% 的相对提升。

关键词

引用

@article{arxiv.2206.13443,
  title  = {CopyCat2: A Single Model for Multi-Speaker TTS and Many-to-Many Fine-Grained Prosody Transfer},
  author = {Sri Karlapati and Penny Karanasou and Mateusz Lajszczak and Ammar Abbas and Alexis Moinet and Peter Makarov and Ray Li and Arent van Korlaar and Simon Slangen and Thomas Drugman},
  journal= {arXiv preprint arXiv:2206.13443},
  year   = {2022}
}

备注

Accepted to be published in the Proceedings of InterSpeech 2022