基于 Transformer-XL 的具有多序列时值音符的音乐生成
声音
2020-07-15 v1 多媒体
音频与语音处理
摘要
当前最先进的基于 AI 的古典音乐创作算法(如 Music Transformer)通过使用带时间偏移的单音符序列进行训练。绝对时间间隔表示的重大缺陷在于,难以计算在同一或不同 MIDI 文件中共享相同音符时值但速度不同的音符的相似性。此外,单序列的使用限制了模型分别且有效地学习诸如和声与节奏的音乐信息。在本文中,我们提出一个带有两种新方法的框架来分别解决这两点不足,其一为构建将音符时值从速度中解放出来的时值音符序列,其二是分离使用四个序列,即前一音符起始到当前音符起始、音符起始到音符结束、音高和力度,以联合训练四个 Transformer-XL 网络。通过在 23 小时钢琴 MIDI 数据集上训练,我们的框架生成了显著更好且时长长达小时级更长的音乐,优于三个最先进基线,即 Music Transformer、DeepJ 和基于单序列的 Transformer-XL,经自动与人工评估。
引用
@article{arxiv.2007.07244,
title = {Transformer-XL Based Music Generation with Multiple Sequences of Time-valued Notes},
author = {Xianchao Wu and Chengyuan Wang and Qinying Lei},
journal= {arXiv preprint arXiv:2007.07244},
year = {2020}
}
备注
9 pages, 7 figures