PromptSpeaker:基于文本描述的说话人生成
声音
2023-10-10 v1 音频与语音处理
摘要
近来,文本引导的内容生成受到了广泛关注。在本工作中,我们探索了基于文本描述的说话人生成的可能性,即利用文本提示来控制说话人生成过程。具体而言,我们提出了 PromptSpeaker,一个文本引导的说话人生成系统。PromptSpeaker 由提示编码器、零样本 VITS 和 Glow 模型组成,其中提示编码器基于文本描述预测先验分布,并从该分布中采样以获得语义表示。随后 Glow 模型将语义表示转换为说话人表示,零样本 VITS 最终基于该说话人表示合成说话人的语音。我们通过客观指标验证了 PromptSpeaker 能够生成训练集之外的新说话人,且合成说话人语音与说话人提示具有合理的主观匹配质量。
引用
@article{arxiv.2310.05001,
title = {PromptSpeaker: Speaker Generation Based on Text Descriptions},
author = {Yongmao Zhang and Guanghou Liu and Yi Lei and Yunlin Chen and Hao Yin and Lei Xie and Zhifei Li},
journal= {arXiv preprint arXiv:2310.05001},
year = {2023}
}
备注
Accepted to ASRU 2023