Cotatron:用于无并行数据任意到多语音转换的转录引导语音编码器
音频与语音处理
2020-08-17 v2 机器学习
声音
摘要
我们提出 Cotatron,一种用于说话人无关语言表示的转录引导语音编码器。Cotatron 基于多说话人 TTS 架构,并可使用常规 TTS 数据集进行训练。我们训练了一个语音转换系统,利用 Cotatron 特征重建语音,这类似于先前基于音素后验图(Phonetic Posteriorgram, PPG)的方法。通过使用 VCTK 数据集中的 108 位说话人进行训练和评估,我们在自然度和说话人相似度方面均优于先前的方法。我们的系统还能转换训练期间未见的说话人语音,并利用 ASR 自动化转录且性能下降极小。音频样本可在 https://mindslab-ai.github.io/cotatron 获取,代码及预训练模型将很快公开。
引用
@article{arxiv.2005.03295,
title = {Cotatron: Transcription-Guided Speech Encoder for Any-to-Many Voice Conversion without Parallel Data},
author = {Seung-won Park and Doo-young Kim and Myun-chul Joe},
journal= {arXiv preprint arXiv:2005.03295},
year = {2020}
}
备注
To appear in INTERSPEECH 2020