中文

用于语音生成的跨语句条件化VAE

声音 2024-09-20 v2 计算与语言 音频与语音处理

摘要

由神经网络驱动的语音合成系统有望用于多媒体制作,但常面临生成富有表现力语音和无缝编辑的问题。为此,我们提出跨语句条件化变分自编码器语音合成(CUC-VAE S2)框架,以增强韵律并确保自然语音生成。该框架利用了预训练语言模型的强大表征能力以及变分自编码器(VAEs)的再表达能力。CUC-VAE S2框架的核心组件是跨语句CVAE,其从周围句子提取声学、说话人与文本特征,以生成上下文敏感的韵律特征,更准确地模拟人类韵律生成。我们进一步提出两种针对不同的语音合成应用的实用算法:用于文本转语音的CUC-VAE TTS和用于语音编辑的CUC-VAE SE。CUC-VAE TTS是该框架的直接应用,旨在生成带有源自周围文本的上下文韵律的音频。另一方面,CUC-VAE SE算法利用以上下文信息为条件的真实mel谱图采样,生成贴近真实声音的音频,从而便于基于文本(如删除、插入和替换)的灵活语音编辑。在LibriTTS数据集上的实验结果表明,我们提出的模型显著增强了语音合成与编辑,生成更自然且更具表现力的语音。

关键词

引用

@article{arxiv.2309.04156,
  title  = {Cross-Utterance Conditioned VAE for Speech Generation},
  author = {Yang Li and Cheng Yu and Guangzhi Sun and Weiqin Zu and Zheng Tian and Ying Wen and Wei Pan and Chao Zhang and Jun Wang and Yang Yang and Fanglei Sun},
  journal= {arXiv preprint arXiv:2309.04156},
  year   = {2024}
}

备注

13 pages;