中文

语音生成式潜变量模型基准评测

音频与语音处理 2022-04-06 v2 人工智能 机器学习 声音 机器学习

摘要

随机潜变量模型(LVMs)在自然图像生成上达到了最先进的性能,但在语音上仍逊于确定性模型。本文建立了一个流行的时间 LVM 语音基准,并将其与最先进的确定性模型进行比较。我们报告了似然值——这是图像领域常用但在语音模型中很少或不可比地报告的指标。为评估所学表征的质量,我们还比较了它们对音素识别的有用性。最后,我们将用于视频生成的最先进时间 LVM——Clockwork VAE 适配到语音领域。尽管仅在潜空间中是自回归的,我们发现 Clockwork VAE 能超越先前的 LVM,并通过使用潜变量层次结构缩小与确定性模型的差距。

关键词

引用

@article{arxiv.2202.12707,
  title  = {Benchmarking Generative Latent Variable Models for Speech},
  author = {Jakob D. Havtorn and Lasse Borgholt and Søren Hauberg and Jes Frellsen and Lars Maaløe},
  journal= {arXiv preprint arXiv:2202.12707},
  year   = {2022}
}

备注

Accepted at the 2022 ICLR workshop on Deep Generative Models for Highly Structured Data (https://deep-gen-struct.github.io)