机器生成音乐的可解释检测与早期系统评估
声音
2026-04-30 v2 音频与语音处理
摘要
机器生成音乐(MGM)已成为一项突破性创新,在音乐治疗、个性化编辑和音乐产业内的创意灵感等领域具有广泛的应用。然而,MGM的无序扩散对娱乐、教育和艺术领域构成了巨大挑战,可能削弱高质量人类作品的价值。因此,MGM检测(MGMD)对于维护这些领域的完整性至关重要。尽管意义重大,MGMD领域缺乏必要的全面系统评估结果来推动有意义的进展。为填补这一空白,我们使用一系列用于音频处理的基础模型在现有大规模数据集上进行实验,建立了针对MGMD任务的系统评估结果。我们的选择包括传统机器学习模型、深度神经网络、基于Transformer的架构和状态空间模型(SSM)。认识到音乐本质上具有多模态特性,融合了旋律和歌词,我们在实验中也探索了基础多模态模型。除了提供基本的二分类结果,我们使用多种可解释人工智能(XAI)工具深入分析模型行为,洞察其决策过程。我们的分析表明,根据域内和域外测试,ResNet18表现最佳。通过提供系统评估结果及其可解释性的全面比较,我们提出了几个方向以启发未来研究,开发更鲁棒和有效的MGM检测方法。我们在GitHub仓库中提供了代码和一些样本。
引用
@article{arxiv.2412.13421,
title = {Explainable Detection of Machine Generated Music and Early Systematic Evaluation},
author = {Yupei Li and Qiyang Sun and Hanqian Li and Lucia Specia and Björn W. Schuller},
journal= {arXiv preprint arXiv:2412.13421},
year = {2026}
}
备注
Accepted at Scientific report