中文

基于最优传输的高斯混合模型插值的中间属性说话人生成

声音 2022-10-19 v1 音频与语音处理

摘要

在本文中,我们提出一种在“说话人生成”这一新兴任务中对多个说话人属性进行中介化并使其声音特征多样化的方法,该任务旨在合成不存在的说话人的自然发声语音。常规的基于 TacoSpawn 的说话人生成方法通过以说话人属性为条件的高斯混合模型(GMMs)来表示说话人嵌入的分布。尽管该方法能够从感知说话人属性的 GMMs 中采样各种说话人,但所学分布是否能表示具有中间属性(即中间属性)的说话人尚不清楚。为此,我们提出一种基于最优传输的方法,插值所学 GMMs 以生成具有中间属性(例如性别中立)语音的不存在说话人。我们凭经验验证了我们的方法,并评估了合成语音的自然度以及两个说话人属性:性别和语言流利度的可控性。评估结果表明,我们的方法能够通过连续标量值控制所生成说话人的属性,且语音自然度无统计显著的退化。

关键词

引用

@article{arxiv.2210.09916,
  title  = {Mid-attribute speaker generation using optimal-transport-based interpolation of Gaussian mixture models},
  author = {Aya Watanabe and Shinnosuke Takamichi and Yuki Saito and Detai Xin and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2210.09916},
  year   = {2022}
}

备注

Submitted to ICASSP 2023. Demo: https://sarulab-speech.github.io/demo_mid-attribute-speaker-generation