中文

Cotatron:用于无并行数据任意到多语音转换的转录引导语音编码器

音频与语音处理 2020-08-17 v2 机器学习 声音

摘要

我们提出 Cotatron,一种用于说话人无关语言表示的转录引导语音编码器。Cotatron 基于多说话人 TTS 架构,并可使用常规 TTS 数据集进行训练。我们训练了一个语音转换系统,利用 Cotatron 特征重建语音,这类似于先前基于音素后验图(Phonetic Posteriorgram, PPG)的方法。通过使用 VCTK 数据集中的 108 位说话人进行训练和评估,我们在自然度和说话人相似度方面均优于先前的方法。我们的系统还能转换训练期间未见的说话人语音,并利用 ASR 自动化转录且性能下降极小。音频样本可在 https://mindslab-ai.github.io/cotatron 获取,代码及预训练模型将很快公开。

关键词

引用

@article{arxiv.2005.03295,
  title  = {Cotatron: Transcription-Guided Speech Encoder for Any-to-Many Voice Conversion without Parallel Data},
  author = {Seung-won Park and Doo-young Kim and Myun-chul Joe},
  journal= {arXiv preprint arXiv:2005.03295},
  year   = {2020}
}

备注

To appear in INTERSPEECH 2020