从音频中进行无监督音乐对象发现
声音
2023-11-15 v2 机器学习
音频与语音处理
摘要
当前以对象为中心的学习模型(如流行的 SlotAttention 架构)允许无监督的视觉场景分解。我们的新方法 MusicSlots 将 SlotAttention 适配到音频领域,以实现无监督音乐分解。由于视觉中的不透明度和遮挡概念在听觉中没有对应物,视觉以对象为中心模型解码器中 alpha 掩码的 softmax 归一化并不适合分解音频对象。MusicSlots 克服了这一问题。我们引入了一个基于谱图的面向西方调性音乐的多对象音乐数据集,专门用于评估以对象为中心的学习。MusicSlots 在无监督音符发现上取得了良好性能,并在有监督音符属性预测任务上优于若干已有基线。
引用
@article{arxiv.2311.07534,
title = {Unsupervised Musical Object Discovery from Audio},
author = {Joonsu Gha and Vincent Herrmann and Benjamin Grewe and Jürgen Schmidhuber and Anand Gopalakrishnan},
journal= {arXiv preprint arXiv:2311.07534},
year = {2023}
}
备注
Accepted to Machine Learning for Audio Workshop, NeurIPS 2023