PerformanceNet:基于多频带卷积残差网络的乐谱到音频音乐生成
声音
2018-11-13 v1 多媒体
音频与语音处理
摘要
音乐创作通常由两部分组成:创作乐谱,然后用乐器演奏乐谱以发出声音。尽管近期工作在符号域的自动音乐生成方面取得了很大进展,但构建能够从乐谱渲染逼真音乐音频的AI模型尝试甚少。直接使用声音样本库合成音频往往导致机械和单调的结果,因为乐谱不包含演奏级信息,例如时序和力度的细微变化。此外,虽然该任务听起来像文本到语音合成问题,但存在根本差异,因为音乐音频具有丰富的复调声音。为构建这样一个AI演奏者,我们在本文中提出一种深度卷积模型,以端到端方式学习称为钢琴卷帘的音乐符号表示与称为频谱图的音乐音频表示之间的乐谱到音频映射。该模型由两个子网络组成:ContourNet,使用U-Net结构学习钢琴卷帘与频谱图之间的对应并给出初始结果;以及TextureNet,进一步使用多频带残差网络通过添加泛音和音色的频谱纹理来细化结果。我们用中等规模的数据集训练模型生成小提琴、大提琴和长笛的音乐片段。我们还展示了一项用户研究的结果,表明我们的模型在自然度和情感表现力上的平均意见得分(MOS)高于基于WaveNet的模型和两个商业声音库。我们在 https://github.com/bwang514/PerformanceNet 开源了代码。
引用
@article{arxiv.1811.04357,
title = {PerformanceNet: Score-to-Audio Music Generation with Multi-Band Convolutional Residual Network},
author = {Bryan Wang and Yi-Hsuan Yang},
journal= {arXiv preprint arXiv:1811.04357},
year = {2018}
}
备注
8 pages, 6 figures, AAAI 2019 camera-ready version