基于二值神经元卷积生成对抗网络的复调音乐生成
机器学习
2018-10-09 v3 人工智能
声音
音频与语音处理
机器学习
摘要
近期研究表明,深度卷积生成对抗网络(GAN)能够学习以钢琴卷帘的形式生成音乐,钢琴卷帘通过二值化的时间-音高矩阵表示音乐。然而,现有模型只能生成实值钢琴卷帘,并需要进一步的后处理(如硬阈值化(HT)或伯努利采样(BS))以获得最终的二值结果。本文研究我们能否通过使用二值神经元,拥有一个直接生成二值钢琴卷帘的卷积GAN模型。具体而言,我们提出在生成器后追加一个额外的精炼网络,该网络在输出层使用二值神经元。整个网络分两阶段训练。首先,预训练生成器与判别器。然后,训练精炼网络与判别器,以学习对预训练生成器创建的实值钢琴卷帘进行二值化。实验结果表明,使用二值神经元替代HT或BS确实在多项客观指标上取得了更好的结果。此外,确定性二值神经元在客观指标与主观测试中均优于随机二值神经元。生成的源代码、训练数据与音频示例可在 https://salu133445.github.io/bmusegan/ 找到。
引用
@article{arxiv.1804.09399,
title = {Convolutional Generative Adversarial Networks with Binary Neurons for Polyphonic Music Generation},
author = {Hao-Wen Dong and Yi-Hsuan Yang},
journal= {arXiv preprint arXiv:1804.09399},
year = {2018}
}
备注
A preliminary version of this paper appeared in ISMIR 2018. In this version, we added an appendix to provide figures of sample results and remarks on the end-to-end models