中文

Blow:一种用于非平行原始音频语音转换的单尺度超条件化流模型

机器学习 2019-09-06 v2 声音 音频与语音处理 机器学习

摘要

原始音频生成的端到端模型是一项挑战,尤其是当它们必须使用非平行数据时,而这在许多场景下都是一种理想的设定。语音转换,即模型需在录音中模仿某说话人,便是此类情形之一。本文提出 Blow,一种采用超网络条件化(hypernetwork conditioning)的单尺度归一化流(normalizing flow),用于在原始音频之间进行多对多语音转换。Blow 以端到端方式、使用非平行数据、基于单说话人标识符按帧进行训练。我们表明,Blow 优于现有的基于流的架构及其他有竞争力的基线,在客观与主观评测中均取得持平或更好的性能。我们进一步通过消融实验评估其主要组件的影响,并量化了若干属性,如所需训练数据量以及对源或目标说话人的偏好。

关键词

引用

@article{arxiv.1906.00794,
  title  = {Blow: a single-scale hyperconditioned flow for non-parallel raw-audio voice conversion},
  author = {Joan Serrà and Santiago Pascual and Carlos Segura},
  journal= {arXiv preprint arXiv:1906.00794},
  year   = {2019}
}

备注

Includes appendix. Accepted for NeurIPS2019