用于无条件语音合成的GAN中的解耦
音频与语音处理
2024-01-26 v2 计算与语言
声音
摘要
我们能否开发一个无需显式条件即可直接从潜空间合成真实语音的模型?尽管过去十年已有若干尝试,此前的对抗与扩散方法仍难以实现这一点,即便在小词汇量数据集上也是如此。为此,我们提出AudioStyleGAN(ASGAN)——一种用于无条件语音合成、旨在学习解耦潜空间的生成对抗网络(GAN)。基于StyleGAN系列图像合成模型,ASGAN将采样噪声映射为解耦潜向量,再映射为音频特征序列,从而在每一层抑制信号混叠。为成功训练ASGAN,我们引入若干新技术,包括对自适应判别器增强的修改,以概率性跳过判别器更新。我们将其应用于小词汇量Google Speech Commands数字数据集,在无条件语音合成上取得最先进结果,且比现有顶尖扩散模型显著更快。我们确认ASGAN的潜空间是解耦的:展示了该空间中简单线性操作即可用于完成训练时未见的若干任务,具体在语音转换、语音增强、说话人验证和关键词分类中进行了评估。我们的工作表明GAN在无条件语音合成领域仍具高度竞争力,且解耦潜空间可助益对未见任务的泛化。代码、模型、样本:https://github.com/RF5/simple-asgan/
引用
@article{arxiv.2307.01673,
title = {Disentanglement in a GAN for Unconditional Speech Synthesis},
author = {Matthew Baas and Herman Kamper},
journal= {arXiv preprint arXiv:2307.01673},
year = {2024}
}
备注
12 pages, 5 tables, 4 figures. Accepted to IEEE TASLP. arXiv admin note: substantial text overlap with arXiv:2210.05271