中文

CopyCat:面向神经文本转语音的多对多细粒度韵律迁移

音频与语音处理 2021-03-11 v1 声音

摘要

韵律迁移(PT)是一种旨在以源音频的韵律作为参考来合成语音的技术。细粒度PT旨在以极细的粒度从源音频中捕捉节奏、重音、旋律、时长和响度等韵律方面,并在以不同目标说话人声音合成语音时迁移这些特征。当前的细粒度PT方法存在源说话人泄漏问题,即合成语音具有源说话人的声音身份而非目标说话人。为缓解该问题,它们不得不牺牲PT的质量。本文提出CopyCat,一种新颖的、无需平行数据的多对多PT系统,其对源说话人泄漏具有鲁棒性。我们通过一种能够捕捉对源说话人泄漏鲁棒的时序韵律表示的新型参考编码器架构实现了这一点。我们通过多种主观评测将CopyCat与最先进的细粒度PT模型进行比较,结果显示韵律迁移质量相对提升47%47\%,目标说话人身份保持相对提升14%14\%,同时仍保持相同的自然度。

关键词

引用

@article{arxiv.2004.14617,
  title  = {CopyCat: Many-to-Many Fine-Grained Prosody Transfer for Neural Text-to-Speech},
  author = {Sri Karlapati and Alexis Moinet and Arnaud Joly and Viacheslav Klimkov and Daniel Sáez-Trigueros and Thomas Drugman},
  journal= {arXiv preprint arXiv:2004.14617},
  year   = {2021}
}