基于学习音程表示的音乐预测模型
声音
2018-06-25 v1 人工智能
音频与语音处理
摘要
应用于音乐序列的连接主义序列模型(如 RNN)存在两个已知问题:首先,它们具有严格的“绝对音高感知”。因此,它们无法泛化到通常以音高间相对距离感知的音乐概念(如旋律、音阶类型、调式、终止式或和弦类型)。其次,它们难以捕捉重复和音乐形式的概念。本文引入循环门控自编码器(RGAE),一种在音乐序列的音程表示上学习并运行的循环神经网络。相对音高建模增强了泛化能力并降低了输入数据的稀疏性。此外,它可以学习复制并平移操作的序列(即音乐片段的半音移调副本)——这是学习音乐重复结构的一种有前景的能力。我们表明,RGAE 在学习预测单声部旋律方面改进了通用连接主义序列模型的当前最优水平,并且相对与绝对音乐处理模型的集成显著改善了结果。此外,我们表明 RGAE 的相对音高处理天然促进了复制并平移操作序列的学习与生成,因此在该任务上 RGAE 大幅优于常见的绝对音高循环神经网络。
引用
@article{arxiv.1806.08686,
title = {A Predictive Model for Music Based on Learned Interval Representations},
author = {Stefan Lattner and Maarten Grachten and Gerhard Widmer},
journal= {arXiv preprint arXiv:1806.08686},
year = {2018}
}
备注
Paper accepted at the 19th International Society for Music Information Retrieval Conference, ISMIR 2018, Paris, France, September 23-27; 8 pages, 3 figures