从音符级到和弦级神经网络模型用于符号音乐中的声部分离
声音
2020-11-06 v1 人工智能
机器学习
音频与语音处理
摘要
音乐常被体验为并行的音符流或声部的进行。这种现象的程度取决于在从单声部、主调、到复调的声部引导连续体上的位置,这增加了自动声部分离模型设计的复杂性。我们通过将声部分离定义为将音乐分解为若干声流的任务来应对这一连续体,这些声流既与其他声流具有高度的外在感知分离性,又具有高度的内在感知一致性。所提出的声部分离任务允许一个声部分化为多个声部,也允许多个声部汇聚到同一声部。借助这一灵活的任务定义,我们手动标注了一个流行音乐语料库,并用它训练了神经网络,这些网络将音符分配给声部时,要么对和弦中每个音符单独分配(音符级),要么对和弦中所有音符联合分配(和弦级)。训练好的神经模型在从左到右遍历输入和弦序列时贪心地分配音符到声部,使用了多样化的感知驱动输入特征。在提取声部内连续音符对的评测中,两个模型均超越了基于包络提取函数迭代应用的强基线,且和弦级模型始终略优于音符级模型。这两个模型在巴赫音乐声部分离上也展现出优于以往方法的表现。
引用
@article{arxiv.2011.03028,
title = {From Note-Level to Chord-Level Neural Network Models for Voice Separation in Symbolic Music},
author = {Patrick Gray and Razvan Bunescu},
journal= {arXiv preprint arXiv:2011.03028},
year = {2020}
}
备注
Paper submitted for publication in August 2018