利用 MAESTRO 数据集实现因子化钢琴音乐建模与生成
声音
2019-01-21 v5 机器学习
音频与语音处理
机器学习
摘要
直接用神经网络生成音乐音频是出了名的困难,因为它需要在许多不同时间尺度上连贯地建模结构。幸运的是,大多数音乐也具有高度结构性,并可以表示为演奏在乐器上的离散音符事件。在此,我们展示通过使用音符作为中间表示,我们可以训练一套能够跨六个数量级(约 0.1 ms 到约 100 s)时间尺度转录、作曲和合成具有连贯音乐结构的音频波形的模型,我们将此过程称为 Wave2Midi2Wave。这一艺术水平的巨大进步得益于我们发布的新的 MAESTRO(MIDI and Audio Edited for Synchronous TRacks and Organization)数据集,其由超过 172 小时的精湛钢琴演奏组成,音符标签与音频波形之间以精细对齐(约 3 ms)捕获。这些网络与数据集共同提出了一种通向创建新的富有表现力且可解释的神经网络音乐模型的有前景的方法。
引用
@article{arxiv.1810.12247,
title = {Enabling Factorized Piano Music Modeling and Generation with the MAESTRO Dataset},
author = {Curtis Hawthorne and Andriy Stasyuk and Adam Roberts and Ian Simon and Cheng-Zhi Anna Huang and Sander Dieleman and Erich Elsen and Jesse Engel and Douglas Eck},
journal= {arXiv preprint arXiv:1810.12247},
year = {2019}
}
备注
Examples available at https://goo.gl/magenta/maestro-examples