基于生成对抗网络的音频合成中不同信号表示的比较
音频与语音处理
2020-06-18 v2 声音
摘要
本文比较了不同的音频信号表示,包括原始音频波形以及多种时频表示,用于基于生成对抗网络(GAN)的音频合成任务。我们在 NSynth 数据集的一个子集上进行实验。网络架构采用基准的渐进式增长 Wasserstein GAN。我们既以完全无条件的模式进行实验,也将音高信息作为条件输入网络。我们利用评估生成模型的标准指标对生成的材料进行定量评估,并比较训练与采样时间。我们表明,短时傅里叶变换的复数值表示以及幅度和瞬时频率取得了最佳结果,并且生成与逆变换时间较快。用于特征提取、训练和评估模型的代码已在线提供。
引用
@article{arxiv.2006.09266,
title = {Comparing Representations for Audio Synthesis Using Generative Adversarial Networks},
author = {Javier Nistal and Stefan Lattner and Gaël Richard},
journal= {arXiv preprint arXiv:2006.09266},
year = {2020}
}
备注
5 pages, 1 figure, 5 tables, to be published in European Signal Processing Conference (EUSIPCO)