TextrolSpeech:一种基于编解码语言文本转语音模型的文本风格控制语音语料库
音频与语音处理
2024-04-26 v1 机器学习
声音
摘要
近年来,可控文本转语音(TTS)领域的研究兴趣日益增长。以往研究依赖用户基于声学知识提供特定风格因子数值或选取满足特定要求的参考语音,而仅从自然文本提示生成语音已成为研究者面临的新挑战。该挑战源于缺乏带自然文本风格提示的高质量语音数据集以及先进文本可控 TTS 模型的缺失。有鉴于此,1)我们提出 TextrolSpeech,这是首个以丰富文本属性标注的大规模语音情感数据集。该数据集包含 236,220 对自然文本描述中的风格提示(含五种风格因子)及相应语音样本。通过迭代实验,我们引入多阶段提示编程方法,有效利用 GPT 模型大规模生成自然风格描述。2)此外,为满足生成更具风格多样性音频的需求,我们提出一种名为 Salle 的高效架构。该架构将文本可控 TTS 视为语言模型任务,利用音频编解码码作为中间表示以替代传统的梅尔频谱图。最后,我们在可控 TTS 任务中展示了所提模型具有可比性能,成功验证了其能力。音频样本见 https://sall-e.github.io/
引用
@article{arxiv.2308.14430,
title = {TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models},
author = {Shengpeng Ji and Jialong Zuo and Minghui Fang and Ziyue Jiang and Feiyang Chen and Xinyu Duan and Baoxing Huai and Zhou Zhao},
journal= {arXiv preprint arXiv:2308.14430},
year = {2024}
}