名古屋大学用于2020语音转换挑战赛的语音转换系统:序列到序列模型与自回归神经声码器的有效性研究
音频与语音处理
2020-10-12 v1 计算与语言
声音
摘要
本文介绍了名古屋大学(NU)为2020语音转换挑战赛(VCC2020)开发的语音转换(VC)系统。我们旨在确定两项近期重要技术在VC中的有效性:序列到序列(seq2seq)模型与自回归(AR)神经声码器。针对挑战赛中的两项任务分别开发了相应系统:对于任务1,我们采用了Voice Transformer Network(一种基于Transformer的seq2seq VC模型),并利用合成并行数据对其进行扩展以处理非并行数据;对于任务2,我们使用基于帧的循环变分自编码器(CycleVAE)对语音波形的频谱特征建模,并采用经额外微调的AR WaveNet声码器。通过与基线系统比较,我们确认seq2seq建模可改善转换相似度,且使用AR声码器可提升转换语音的自然度。
引用
@article{arxiv.2010.04446,
title = {The NU Voice Conversion System for the Voice Conversion Challenge 2020: On the Effectiveness of Sequence-to-sequence Models and Autoregressive Neural Vocoders},
author = {Wen-Chin Huang and Patrick Lumban Tobing and Yi-Chiao Wu and Kazuhiro Kobayashi and Tomoki Toda},
journal= {arXiv preprint arXiv:2010.04446},
year = {2020}
}
备注
Accepted to the ISCA Joint Workshop for the Blizzard Challenge and Voice Conversion Challenge 2020