印度艺术音乐中拉格识别的可解释深度学习分析
音频与语音处理
2025-07-01 v2 人工智能
摘要
拉格识别是印度艺术音乐领域中的一个重要问题,因为拉格是其作曲和表演的基础,在音乐检索、保存和教育中起着关键作用。少数探索该任务的研究采用了信号处理、机器学习(ML)以及最近的深度学习(DL)方法。然而,所有这些工作都留下了一个关键问题未解答:这些ML/DL方法是否以类似于人类专家的方式学习和解释拉格?此外,这项研究的一个重大障碍是缺乏丰富、标注数据集的充足供应,这推动了这些基于ML/DL的方法。在本文中,我们首先整理了一个包含191小时印度斯坦古典音乐(HCM)录音的数据集,为其标注拉格和主音标签,并训练了一个CNN-LSTM模型用于自动拉格识别(ARI)任务。我们在12个拉格类别的子集上实现了0.89的片段级f1分数。随后,我们首次尝试使用模型可解释性技术:SoundLIME和GradCAM++进行拉格识别,以评估分类器的预测是否与人类对拉格的理解一致。我们将生成的解释与人类专家标注进行比较,并进一步分析单个测试样本,以理解解释所突出区域在模型做出正确或错误预测中的作用。我们的结果表明模型的理解与人类理解显著一致,深入分析验证了我们方法的有效性。
引用
@article{arxiv.2406.02443,
title = {Explainable Deep Learning Analysis for Raga Identification in Indian Art Music},
author = {Parampreet Singh and Vipul Arora},
journal= {arXiv preprint arXiv:2406.02443},
year = {2025}
}