中文

对抗生成时频特征及其在音频合成中的应用

声音 2019-05-17 v2 机器学习 音频与语音处理 机器学习

摘要

时频(TF)表示为分析音频等时间序列提供了强大且直观的特征。但尽管如此,在TF域中对音频进行生成式建模仍是一件微妙的事情。因此,神经音频合成广泛依赖于直接对波形建模,而先前从神经生成的不可逆TF特征无条件合成音频的尝试仍难以产生令人满意的音频质量。在本文中,我们聚焦于短时傅里叶变换,讨论基于生成的不可逆TF特征进行音频合成时所出现的挑战以及如何克服它们。我们通过在短时傅里叶特征上训练生成对抗网络(GAN)来展示审慎的生成式TF建模的潜力。我们表明,在应用我们的指导原则后,尽管两个网络架构相似,我们基于TF的网络能够胜过直接生成波形的最先进GAN。

关键词

引用

@article{arxiv.1902.04072,
  title  = {Adversarial Generation of Time-Frequency Features with application in audio synthesis},
  author = {Andrés Marafioti and Nicki Holighaus and Nathanaël Perraudin and Piotr Majdak},
  journal= {arXiv preprint arXiv:1902.04072},
  year   = {2019}
}

备注

Accepted for publication at ICML 2019