中文

从音频中进行无监督音乐对象发现

声音 2023-11-15 v2 机器学习 音频与语音处理

摘要

当前以对象为中心的学习模型(如流行的 SlotAttention 架构)允许无监督的视觉场景分解。我们的新方法 MusicSlots 将 SlotAttention 适配到音频领域,以实现无监督音乐分解。由于视觉中的不透明度和遮挡概念在听觉中没有对应物,视觉以对象为中心模型解码器中 alpha 掩码的 softmax 归一化并不适合分解音频对象。MusicSlots 克服了这一问题。我们引入了一个基于谱图的面向西方调性音乐的多对象音乐数据集,专门用于评估以对象为中心的学习。MusicSlots 在无监督音符发现上取得了良好性能,并在有监督音符属性预测任务上优于若干已有基线。

关键词

引用

@article{arxiv.2311.07534,
  title  = {Unsupervised Musical Object Discovery from Audio},
  author = {Joonsu Gha and Vincent Herrmann and Benjamin Grewe and Jürgen Schmidhuber and Anand Gopalakrishnan},
  journal= {arXiv preprint arXiv:2311.07534},
  year   = {2023}
}

备注

Accepted to Machine Learning for Audio Workshop, NeurIPS 2023