中文

基于聚合多尺度编码器-解码器网络的多步和弦序列预测

机器学习 2019-11-13 v1 声音 音频与语音处理 机器学习

摘要

本文研究利用机器学习模型预测爵士乐的和弦进行。我们研究的动机来自神经网络在执行自动音乐创作方面近期的成功。尽管在单步预测场景中获得了高准确率,大多数模型无法生成准确的多步和弦预测。本文中,我们假定这源于音乐信息的多尺度结构,并基于输入标签的迭代时间聚合提出新架构。具体而言,输入和真值标签被合并为逐渐增大的时间袋,我们在每个时间尺度上训练一系列编码器-解码器网络。第二步,我们在每个尺度上使用这些预训练的编码器瓶颈特征以训练最终的编码器-解码器网络。此外,我们依赖初始和弦字母表到三种适配和弦字母表的不同归约。我们针对若干最先进模型进行评估,表明我们的多尺度架构在准确率和困惑度方面优于现有方法,同时所需参数相对较少。我们分析结果的音乐属性,显示分析窗口内强拍位置对准确率的影响,并使用音乐知情的距离度量评估误差。

关键词

引用

@article{arxiv.1911.04972,
  title  = {Multi-Step Chord Sequence Prediction Based on Aggregated Multi-Scale Encoder-Decoder Network},
  author = {Tristan Carsault and Andrew McLeod and Philippe Esling and Jérôme Nika and Eita Nakamura and Kazuyoshi Yoshii},
  journal= {arXiv preprint arXiv:1911.04972},
  year   = {2019}
}

备注

Accepted for publication in MLSP, 2019