在音频域循环生成中利用预训练特征网络于生成对抗网络
声音
2022-09-07 v1 音频与语音处理
摘要
尽管生成对抗网络(GANs)已广泛应用于音频生成研究,但众所周知 GAN 模型的训练不稳定、耗时且数据效率低。在改善 GAN 训练过程的诸多尝试中,Projected GAN 的思想作为基于 GAN 的图像生成的有效方案脱颖而出,在不同图像应用中确立了 SOTA。其核心思想是使用预训练分类器来约束判别器的特征空间,以稳定并改进 GAN 训练。本文探究 Projected GAN 是否能类似地改进音频生成,通过评估基于 StyleGAN2 的音频域循环生成模型在判别器中使用与不使用预训练特征空间时的性能。此外,我们比较了使用通用分类器与领域特定分类器作为预训练音频分类器的性能。通过在鼓循环与合成器循环生成上的实验,我们表明通用音频分类器表现更好,且借助 Projected GAN,我们的循环生成模型可在性能不退化的情况下以约 5 倍速度收敛。
引用
@article{arxiv.2209.01751,
title = {Exploiting Pre-trained Feature Networks for Generative Adversarial Networks in Audio-domain Loop Generation},
author = {Yen-Tung Yeh and Bo-Yu Chen and Yi-Hsuan Yang},
journal= {arXiv preprint arXiv:2209.01751},
year = {2022}
}
备注
Accepted at ISMIR 2022