说话人生成
声音
2021-11-10 v1 计算与语言
机器学习
音频与语音处理
摘要
本工作探索了以不存在的类人声声音合成语音的任务。我们称此任务为“说话人生成”,并提出了 TacoSpawn,一个在该任务上表现具竞争力的系统。TacoSpawn 是一个基于循环注意力机制的自回归文本到语音模型,它学习说话人嵌入空间上的分布,从而能够采样新颖且多样的说话人。我们的方法易于实现,且不需要来自说话人 ID 系统的迁移学习。我们提出了用于评估该任务性能的客观测度与主观度量,并证明我们所提出的客观度量与人类对说话人相似度的感知相关。音频样本可在我们的演示页面获取。
引用
@article{arxiv.2111.05095,
title = {Speaker Generation},
author = {Daisy Stanton and Matt Shannon and Soroosh Mariooryad and RJ Skerry-Ryan and Eric Battenberg and Tom Bagby and David Kao},
journal= {arXiv preprint arXiv:2111.05095},
year = {2021}
}
备注
12 pages, 3 figures, 4 tables, appendix with 2 tables