用于序列到序列语音转换的预训练技术
音频与语音处理
2020-08-10 v1 计算与语言
声音
摘要
序列到序列(seq2seq)语音转换(VC)模型因其转换韵律的能力而引人注目。然而,在数据不足的情况下,seq2seq VC 模型会遭受训练不稳定和转换语音中发音错误的问题,从而远未实用。为解决这些缺陷,我们提出从其他易于获得大规模语料的语音处理任务迁移知识,典型的是文本到语音(TTS)和自动语音识别(ASR)。我们认为,用此类预训练的 ASR 或 TTS 模型参数初始化的 VC 模型能够生成有效的隐藏表示,用于高保真、高可懂度的转换语音。我们将这些技术应用于基于循环神经网络(RNN)和基于 Transformer 的模型,并通过系统性实验证明了预训练方案的有效性,以及基于 Transformer 的模型在可懂度、自然度和相似度方面优于基于 RNN 的模型。
引用
@article{arxiv.2008.03088,
title = {Pretraining Techniques for Sequence-to-Sequence Voice Conversion},
author = {Wen-Chin Huang and Tomoki Hayashi and Yi-Chiao Wu and Hirokazu Kameoka and Tomoki Toda},
journal= {arXiv preprint arXiv:2008.03088},
year = {2020}
}
备注
Preprint. Under review