中文

学习音乐循环中的正常模式

声音 2025-06-02 v1 信息检索 机器学习 多媒体 音频与语音处理

摘要

本文引入了一个无监督框架,通过异常检测技术检测音乐样本 (循环) 中的音频模式,以应对音乐信息检索 (MIR) 中的挑战。现有方法通常受限于依赖手工特征、特定领域的局限或依赖迭代用户交互。我们通过结合深度特征提取与无监督异常检测的架构来解决这些局限。我们的方法利用预训练的分层 Token 语义音频 Transformer (HTS-AT),结合特征融合机制 (FFM),从变长音频循环中生成表示。这些嵌入使用单类深度支持向量数据描述 (Deep SVDD) 进行处理,该模型通过将音频模式映射到紧凑的潜在超球体来学习规范音频模式。在精选的贝斯和吉他数据集上的评估,将标准和残差自编码器变体与 Isolation Forest (IF) 和主成分分析 (PCA) 等基线方法进行了比较。结果表明,我们的 Deep SVDD 模型,尤其是残差自编码器变体,提供了更好的异常分离度,特别是对于较大的变化。本研究为处理多样化音频样本提供了一种灵活、完全无监督的解决方案,克服了以往的结构和输入限制,并通过基于距离的潜在空间评分实现了有效的模式识别。

关键词

引用

@article{arxiv.2505.23784,
  title  = {Learning Normal Patterns in Musical Loops},
  author = {Shayan Dadman and Bernt Arild Bremdal and Børre Bang and Rune Dalmo},
  journal= {arXiv preprint arXiv:2505.23784},
  year   = {2025}
}

备注

27 pages, 10 figures