MP3net:基于简单卷积GAN从原始音频生成连贯的分钟级音乐
声音
2021-01-14 v1 机器学习
音频与语音处理
摘要
我们提出了一种深度卷积 GAN,它利用 MP3/Vorbis 音频压缩中的技术来生成具有长距离连贯性的长时长、高质量音频样本。该模型使用改进离散余弦变换(MDCT)数据表示,其包含所有相位信息。因此相位生成是模型不可分割的一部分。我们利用人耳的听觉掩蔽与心理声学感知极限来拓宽真实分布并稳定训练过程。模型架构为一个深度 2D 卷积网络,其中每个后续的生成器模型块沿时间轴提高分辨率,并沿频率轴添加一个更高的倍频程。更深的层与输出的所有部分相连,并拥有整条音轨的上下文。这使得生成展现长距离连贯性的样本成为可能。我们使用 MP3net 在单个 Cloud TPUv2 上训练 250 小时后创建了采样率为 22kHz 的 95 秒立体声轨。基于 CNN 的模型架构还有一个额外好处,即新歌曲的生成几乎是瞬时的。
引用
@article{arxiv.2101.04785,
title = {MP3net: coherent, minute-long music generation from raw audio with a simple convolutional GAN},
author = {Korneel van den Broek},
journal= {arXiv preprint arXiv:2101.04785},
year = {2021}
}
备注
11 pages, 8 figures, samples and source code available on https://korneelvdbroek.github.io/mp3net