PromptTTS 2:基于文本提示描述与生成语音
音频与语音处理
2023-10-13 v2 计算与语言
机器学习
声音
摘要
语音比文本传递更多信息,因为同一个词可以用不同的嗓音说出以传达多样的信息。相较于依赖语音提示(参考语音)实现嗓音多变性的传统文本转语音(TTS)方法,使用文本提示(描述)更为用户友好,因为语音提示可能难以获取或根本不存在。基于文本提示的 TTS 方法面临两个主要挑战:1)一对多问题,即文本提示无法描述嗓音多变性中的所有细节;2)文本提示数据集的有限可用性,需要供应商并付出高昂的数据标注成本来为语音撰写文本提示。在本工作中,我们提出 PromptTTS 2 来解决这些挑战,采用变化网络提供文本提示未捕获的嗓音多变性信息,以及提示生成流程利用大语言模型(LLM)撰写高质量文本提示。具体而言,变化网络基于文本提示表示预测从参考语音(包含嗓音多变性的全部信息)中提取的表示。对于提示生成流程,它通过语音语言理解模型从语音中识别嗓音属性(如性别、语速),并由大语言模型基于识别结果生成文本提示。在大规模(44K 小时)语音数据集上的实验表明,与先前工作相比,PromptTTS 2 生成的嗓音与文本提示更为一致,并支持多样嗓音多变性的采样,从而为用户提供更多的语音生成选择。此外,提示生成流程可生成高质量文本提示,消除了高昂的标注成本。PromptTTS 2 的演示页面可在线获取。
引用
@article{arxiv.2309.02285,
title = {PromptTTS 2: Describing and Generating Voices with Text Prompt},
author = {Yichong Leng and Zhifang Guo and Kai Shen and Xu Tan and Zeqian Ju and Yanqing Liu and Yufei Liu and Dongchao Yang and Leying Zhang and Kaitao Song and Lei He and Xiang-Yang Li and Sheng Zhao and Tao Qin and Jiang Bian},
journal= {arXiv preprint arXiv:2309.02285},
year = {2023}
}
备注
Demo page: https://speechresearch.github.io/prompttts2