语音生成式潜变量模型基准评测
音频与语音处理
2022-04-06 v2 人工智能
机器学习
声音
机器学习
摘要
随机潜变量模型(LVMs)在自然图像生成上达到了最先进的性能,但在语音上仍逊于确定性模型。本文建立了一个流行的时间 LVM 语音基准,并将其与最先进的确定性模型进行比较。我们报告了似然值——这是图像领域常用但在语音模型中很少或不可比地报告的指标。为评估所学表征的质量,我们还比较了它们对音素识别的有用性。最后,我们将用于视频生成的最先进时间 LVM——Clockwork VAE 适配到语音领域。尽管仅在潜空间中是自回归的,我们发现 Clockwork VAE 能超越先前的 LVM,并通过使用潜变量层次结构缩小与确定性模型的差距。
引用
@article{arxiv.2202.12707,
title = {Benchmarking Generative Latent Variable Models for Speech},
author = {Jakob D. Havtorn and Lasse Borgholt and Søren Hauberg and Jes Frellsen and Lars Maaløe},
journal= {arXiv preprint arXiv:2202.12707},
year = {2022}
}
备注
Accepted at the 2022 ICLR workshop on Deep Generative Models for Highly Structured Data (https://deep-gen-struct.github.io)