基于深度学习的复调音乐旋律提取方法综述
声音
2022-02-03 v1 音频与语音处理
摘要
旋律提取是音乐信息检索中一项重要的任务,因其在教育学和音乐产业中的潜在应用而备受音乐研究者关注。由于背景乐器的存在,旋律提取是一项出了名的挑战性任务。此外,旋律声源常表现出与其他乐器相似的特征。人声与干扰性背景伴奏混合,使得从混合信号中提取旋律更具挑战性。直到最近,基于经典信号处理的旋律提取方法在旋律提取研究者中仍颇为流行。深度学习模型对大规模数据建模的能力,以及通过利用空间和时间依赖关系学习自动特征的能力,促使许多研究者采用深度学习模型进行旋律提取。本文试图综述用于复调音乐旋律提取的最新数据驱动深度学习方法。现有深度模型已根据所用神经网络类型及其用于预测旋律的输出表示进行了分类。此外,简要介绍了25种旋律提取模型的架构。用于优化旋律提取模型参数的损失函数被宽泛地分为四类,并简要描述了各旋律提取模型所用的损失函数。同时,深入描述了旋律提取模型所采用的各种输入表示及参数设置。文中还包含一节描述黑盒旋律提取深度神经网络可解释性的内容。对25种旋律提取方法的性能进行了比较。文中还给出了探索或改进旋律提取方法的可能未来方向。
引用
@article{arxiv.2202.01078,
title = {Melody Extraction from Polyphonic Music by Deep Learning Approaches: A Review},
author = {Gurunath Reddy M and K. Sreenivasa Rao and Partha Pratim Das},
journal= {arXiv preprint arXiv:2202.01078},
year = {2022}
}
备注
72 pages