基于子带的生成对抗网络用于非平行多对多语音转换
声音
2022-07-28 v2 多媒体
音频与语音处理
摘要
语音转换旨在生成具有源语音内容与目标说话人风格的新语音。本文关注一种通用设定,即非平行多对多语音转换,其贴近真实应用场景。顾名思义,非平行多对多语音转换无需配对的源语音与参考语音,并可应用于任意说话人之间的音色迁移。近年来,生成对抗网络(GAN)与条件变分自编码器(CVAE)等技术在该领域取得了可观进展。然而,由于语音转换任务本身的复杂性,转换后语音的风格相似度仍不尽如人意。受梅尔频谱图固有结构的启发,我们提出了一种新的语音转换框架,即用于语音转换的基于子带的生成对抗网络(SGAN-VC)。SGAN-VC通过显式利用不同子带间的空间特性,分别对源语音的各个子带内容进行转换。SGAN-VC包含一个风格编码器、一个内容编码器与一个解码器。其中,风格编码器网络被设计为学习目标说话人不同子带的风格编码;内容编码器网络可捕获源语音的内容信息;最后,解码器生成特定的子带内容。此外,我们提出一个音高偏移模块以微调源说话人的音高,使转换后的音调更准确且具可解释性。大量实验表明,所提方法在VCTK Corpus与AISHELL3数据集上,无论对可见还是不可见数据,在定性与定量上均达到了最先进的性能。进一步地,SGAN-VC在不可见数据上的内容可懂度甚至超过了借助ASR网络辅助的StarGANv2-VC。
引用
@article{arxiv.2207.06057,
title = {Subband-based Generative Adversarial Network for Non-parallel Many-to-many Voice Conversion},
author = {Jian Ma and Zhedong Zheng and Hao Fei and Feng Zheng and Tat-seng Chua and Yi Yang},
journal= {arXiv preprint arXiv:2207.06057},
year = {2022}
}