中文

MuSpike:基于脉冲神经网络的符号音乐生成基准与评估框架

声音 2025-08-28 v1 人工智能 音频与语音处理

摘要

符号音乐生成在人工神经网络的推动下取得了快速进展,但在生物学上合理的脉冲神经网络(SNN)领域仍处于探索不足的阶段,既缺乏标准化基准,也缺乏全面的评估方法。为了填补这一空白,我们引入了 MuSpike,这是一个统一的基准与评估框架,在五个典型数据集上系统评估了五种代表性的 SNN 架构(SNN-CNN、SNN-RNN、SNN-LSTM、SNN-GAN 和 SNN-Transformer),涵盖调性、结构、情感和风格的变化。MuSpike 强调全面评估,将现有的客观指标与大规模听音研究相结合。我们提出了新的主观指标,针对音乐印象、自传联想和个人偏好,捕捉先前工作中常被忽视的感知维度。结果显示:(1) 不同的 SNN 模型在不同的评估维度上表现出不同的优势;(2) 具有不同音乐背景的参与者表现出多样化的感知模式,专家对 AI 作曲的音乐表现出更高的容忍度;(3) 客观评估与主观评估之间存在明显的错位,凸显了纯统计指标的局限性,并强调了人类感知判断在评估音乐质量中的价值。MuSpike 为符号音乐生成中的 SNN 模型提供了首个系统性基准和系统化评估框架,为未来研究生物学上合理且认知上扎根的音乐生成奠定了坚实基础。

关键词

引用

@article{arxiv.2508.19251,
  title  = {MuSpike: A Benchmark and Evaluation Framework for Symbolic Music Generation with Spiking Neural Networks},
  author = {Qian Liang and Menghaoran Tang and Yi Zeng},
  journal= {arXiv preprint arXiv:2508.19251},
  year   = {2025}
}