语音转换挑战 2020 的序列到序列基线:级联 ASR 与 TTS
音频与语音处理
2020-10-07 v1 计算与语言
声音
摘要
本文提出语音转换挑战(VCC)2020 的序列到序列(seq2seq)基线系统。我们考虑一种朴素的语音转换(VC)方法,即先用自动语音识别(ASR)模型转写输入语音,再利用转写文本通过文本到语音(TTS)模型生成目标说话人语音。我们在序列到序列(seq2seq)框架下借助开源端到端语音处理工具包 ESPnet 及社区提供的许多配置良好的预训练模型重访该方法。官方评估结果显示,我们的系统在转换相似度方面于参与系统中位居首位,展示了 seq2seq 模型转换说话人身份的前景能力。实现已开源:https://github.com/espnet/espnet/tree/master/egs/vcc20。
引用
@article{arxiv.2010.02434,
title = {The Sequence-to-Sequence Baseline for the Voice Conversion Challenge 2020: Cascading ASR and TTS},
author = {Wen-Chin Huang and Tomoki Hayashi and Shinji Watanabe and Tomoki Toda},
journal= {arXiv preprint arXiv:2010.02434},
year = {2020}
}
备注
Accepted to the ISCA Joint Workshop for the Blizzard Challenge and Voice Conversion Challenge 2020