对抗生成时频特征及其在音频合成中的应用
声音
2019-05-17 v2 机器学习
音频与语音处理
机器学习
摘要
时频(TF)表示为分析音频等时间序列提供了强大且直观的特征。但尽管如此,在TF域中对音频进行生成式建模仍是一件微妙的事情。因此,神经音频合成广泛依赖于直接对波形建模,而先前从神经生成的不可逆TF特征无条件合成音频的尝试仍难以产生令人满意的音频质量。在本文中,我们聚焦于短时傅里叶变换,讨论基于生成的不可逆TF特征进行音频合成时所出现的挑战以及如何克服它们。我们通过在短时傅里叶特征上训练生成对抗网络(GAN)来展示审慎的生成式TF建模的潜力。我们表明,在应用我们的指导原则后,尽管两个网络架构相似,我们基于TF的网络能够胜过直接生成波形的最先进GAN。
引用
@article{arxiv.1902.04072,
title = {Adversarial Generation of Time-Frequency Features with application in audio synthesis},
author = {Andrés Marafioti and Nicki Holighaus and Nathanaël Perraudin and Piotr Majdak},
journal= {arXiv preprint arXiv:1902.04072},
year = {2019}
}
备注
Accepted for publication at ICML 2019