中文

一种语音复数语谱图的深度生成模型

声音 2022-07-18 v1 机器学习 音频与语音处理 机器学习

摘要

本文提出了一种利用深度生成模型对短时傅里叶变换幅度语谱图和相位语谱图进行联合建模的方法。我们假设幅度服从高斯分布,相位服从 von Mises 分布。为了提高时频域中相位值的一致性,我们还将 von Mises 分布应用于相位导数,即群延迟和瞬时频率。基于这些假设,我们探索并比较了用于训练模型的几种损失函数组合。我们的模型建立在变分自编码器框架之上,由三个卷积神经网络组成,分别充当编码器、幅度解码器和相位解码器。除了潜在变量外,我们还提出将相位估计以估计出的幅度为条件。在时域语音重建任务上的评估表明,我们的模型能够生成具有高感知质量和高可懂度的语音。

关键词

引用

@article{arxiv.1903.03269,
  title  = {A Deep Generative Model of Speech Complex Spectrograms},
  author = {Aditya Arie Nugraha and Kouhei Sekiguchi and Kazuyoshi Yoshii},
  journal= {arXiv preprint arXiv:1903.03269},
  year   = {2022}
}