中文

说话人生成

声音 2021-11-10 v1 计算与语言 机器学习 音频与语音处理

摘要

本工作探索了以不存在的类人声声音合成语音的任务。我们称此任务为“说话人生成”,并提出了 TacoSpawn,一个在该任务上表现具竞争力的系统。TacoSpawn 是一个基于循环注意力机制的自回归文本到语音模型,它学习说话人嵌入空间上的分布,从而能够采样新颖且多样的说话人。我们的方法易于实现,且不需要来自说话人 ID 系统的迁移学习。我们提出了用于评估该任务性能的客观测度与主观度量,并证明我们所提出的客观度量与人类对说话人相似度的感知相关。音频样本可在我们的演示页面获取。

关键词

引用

@article{arxiv.2111.05095,
  title  = {Speaker Generation},
  author = {Daisy Stanton and Matt Shannon and Soroosh Mariooryad and RJ Skerry-Ryan and Eric Battenberg and Tom Bagby and David Kao},
  journal= {arXiv preprint arXiv:2111.05095},
  year   = {2021}
}

备注

12 pages, 3 figures, 4 tables, appendix with 2 tables