GAN 你能听到我吗?从扩散模型中夺回无条件语音合成
声音
2022-10-12 v1 人工智能
音频与语音处理
摘要
我们提出了 AudioStyleGAN (ASGAN),一种用于无条件语音合成的新的生成对抗网络 (GAN)。与用于图像合成的 StyleGAN 系列模型一样,ASGAN 将采样噪声映射到一个解耦的潜在向量,然后将其映射到音频特征序列,从而在每一层抑制信号混叠。为了成功训练 ASGAN,我们引入了许多新技术,包括对自适应判别器增强的修改,以概率性地跳过判别器更新。ASGAN 在 Google Speech Commands 数据集上的无条件语音合成中取得了最先进的结果。它还比性能最佳的扩散模型快得多。通过鼓励解耦的设计,ASGAN 能够执行语音转换和语音编辑,而无需经过明确的训练。ASGAN 表明 GAN 在与扩散模型的竞争中仍然具有很强的竞争力。代码、模型、样本:https://github.com/RF5/simple-asgan/。
引用
@article{arxiv.2210.05271,
title = {GAN You Hear Me? Reclaiming Unconditional Speech Synthesis from Diffusion Models},
author = {Matthew Baas and Herman Kamper},
journal= {arXiv preprint arXiv:2210.05271},
year = {2022}
}
备注
6 pages, 2 figures, 2 tables. Accepted at IEEE SLT 2022