NANSY++:基于神经分析与合成的统一语音合成
声音
2022-11-18 v1 音频与语音处理
摘要
各类语音合成应用虽均以“语音”为输出,却独立开发。此外,多数语音合成模型训练仍需大量配对标注标签(如文本转写与乐谱)的音频数据。为此,我们提出从分析特征合成与操控语音信号的统一框架,称为NANSY++。NANSY++骨干网络以自监督方式训练,无需任何与音频配对的标注。训练骨干网络后,我们通过部分建模各任务所需分析特征,高效处理四项语音应用——即语音转换、文本转语音、歌声合成与语音设计。大量实验表明,所提框架具可控性、数据高效与训练收敛快等竞争优势,且提供高质量合成。音频样本:tinyurl.com/8tnsy3uc。
引用
@article{arxiv.2211.09407,
title = {NANSY++: Unified Voice Synthesis with Neural Analysis and Synthesis},
author = {Hyeong-Seok Choi and Jinhyeok Yang and Juheon Lee and Hyeongju Kim},
journal= {arXiv preprint arXiv:2211.09407},
year = {2022}
}
备注
Submitted to ICLR 2023