SC VALL-E:风格可控的零样本文本到语音合成器
声音
2023-07-21 v1 机器学习
音频与语音处理
摘要
为控制语音的各种特征并生成期望声音,表达性语音合成模型通过在数据集中加入具有不同说话人、多种情感与不同说话风格的语料进行训练。本文提出一种基于神经编解码语言模型(称为 VALL-E)的风格控制(SC)VALL-E 模型,其遵循生成式预训练 Transformer 3(GPT-3)的结构。所提 SC VALL-E 以文本句子与提示音频为输入,旨在通过不简单模仿提示音频特征而是控制属性以产生多样声音的方式来生成可控语音。我们在新设计的风格网络的风格嵌入矩阵中识别出代表情感、语速、音高和语音强度等属性的 token,并设计了可控制这些属性的模型。为评估 SC VALL-E 性能,我们与三种代表性表达性语音合成模型进行对比实验:全局风格 token(GST)Tacotron2、变分自编码器(VAE)Tacotron2 和原始 VALL-E。我们以词错误率(WER)、F0 浊音错误率(FVE)和 F0 整体基频错误率(F0GPE)作为评估生成句子准确性的指标,以比较合成语音质量,测量比较均值意见分(CMOS)与相似度均值意见分(SMOS)。为评估生成语音的风格控制能力,我们通过修改训练所得 token 观察 F0 与梅尔频谱图的变化。当使用训练数据中未出现的提示音频时,SC VALL-E 生成多种表达性声音,并展现出与现有模型相比具有竞争力的性能。我们的实现、预训练模型与音频样本已发布于 GitHub。
引用
@article{arxiv.2307.10550,
title = {SC VALL-E: Style-Controllable Zero-Shot Text to Speech Synthesizer},
author = {Daegyeom Kim and Seongho Hong and Yong-Hoon Choi},
journal= {arXiv preprint arXiv:2307.10550},
year = {2023}
}