用于训练稳定 GAN 的条件化技巧
声音
2020-10-13 v1 机器学习
音频与语音处理
摘要
本文提出一种称为正态偏离差的条件化技巧,应用于生成器网络以应对 GAN 训练过程中的不稳定性问题。我们迫使生成器更接近在 Schur 分解的谱域中计算得到的真实样本的正态偏离函数。这种约束使生成器适于截断,且不限制对所有可能模式的探索。我们略微修改 BigGAN 架构,引入残差网络以合成音频信号的二维表示,从而能够重建具有部分保留相位信息的高质量声音。此外,所提出的条件化训练方案在生成谱图的保真度与多样性之间做出权衡。在 UrbanSound8k 和 ESC-50 环境声音数据集以及 Mozilla common voice 数据集上的实验结果表明,根据三个客观指标——inception score、Frechet inception distance 和信噪比(signal-to-noise ratio),所提出的带条件化技巧的 GAN 配置显著优于基线架构。
引用
@article{arxiv.2010.05844,
title = {Conditioning Trick for Training Stable GANs},
author = {Mohammad Esmaeilpour and Raymel Alfonso Sallo and Olivier St-Georges and Patrick Cardinal and Alessandro Lameiras Koerich},
journal= {arXiv preprint arXiv:2010.05844},
year = {2020}
}