中文

TTS Skins:通过ASR进行说话人转换

声音 2020-07-28 v2 机器学习 机器学习

摘要

我们提出一种全卷积wav-to-wav网络,用于在说话人声音间转换而不依赖文本。我们的网络基于编码器-解码器架构,其中编码器针对自动语音识别(ASR)任务预训练,多说话人波形解码器以自回归方式训练以重建原始信号。我们在有声叙事书上训练网络,并通过转换TTS机器人的声音展示那些声音中的多语音TTS。

关键词

引用

@article{arxiv.1904.08983,
  title  = {TTS Skins: Speaker Conversion via ASR},
  author = {Adam Polyak and Lior Wolf and Yaniv Taigman},
  journal= {arXiv preprint arXiv:1904.08983},
  year   = {2020}
}