基于卷积神经网络的音乐边界检测:组合输入特征的比较分析
音频与语音处理
2021-12-02 v2 机器学习
声音
摘要
音乐作品结构分析是人工智能领域尤其是深度学习中仍具挑战性的任务,其需要先验地识别音乐作品的结构边界。近期已有研究使用无监督方法和端到端(end-to-end)技术(如卷积神经网络(CNN))以Mel尺度对数幅度谱(MLS)、自相似矩阵(SSM)或自相似滞后矩阵(SSLM)作为输入并用人工作标注进行训练,来研究该结构边界。已有若干研究分为无监督与端到端方法发表,其中预处理以不同方式进行,使用不同的距离度量和音频特征,因此缺少一种计算模型输入的通用预处理方法。本工作的目标是通过比较由不同池化策略、距离度量和音频特征计算的输入,建立这些输入的通用预处理方法,同时考虑获取它们所需的计算时间。我们还确立了交付给CNN的最有效输入组合,以确定提取音乐作品结构边界的最高效方式。通过适当的输入矩阵与池化策略组合,我们获得了0.411的F_1度量精度,优于当前在相同条件下所得结果。
引用
@article{arxiv.2008.07527,
title = {Music Boundary Detection using Convolutional Neural Networks: A comparative analysis of combined input features},
author = {Carlos Hernandez-Olivan and Jose R. Beltran and David Diaz-Guerra},
journal= {arXiv preprint arXiv:2008.07527},
year = {2021}
}