中文

MART:利用部分-整体 Transformer 学习分层音乐音频表示

声音 2024-04-22 v3 多媒体 音频与语音处理

摘要

最近在音乐表示的自监督对比学习方面的研究已在各种下游任务中展示了显著成果。然而,现有方法的一个普遍趋势是,以波形或频谱图格式表示大小相同的音乐片段,常常忽略了音乐内在的部分-整体层次结构。为了理解音乐的自底向上结构,我们引入了 MART,这是一种分层音乐表示学习方法,在考虑音乐片段的部分-整体层次结构的同时,促进裁剪后的音乐片段之间的特征交互。具体来说,我们提出了一种分层部分-整体 Transformer,以捕获部分-整体层次结构中音乐片段之间的结构关系。此外,我们设计了一个分层对比学习目标,用于在相邻层级对齐部分-整体音乐表示,逐步建立一个多层次的表示空间。我们从部分-整体层次结构学习音乐表示的有效性已在多个下游任务中得到了实证验证,包括音乐分类和翻唱歌曲识别。

关键词

引用

@article{arxiv.2312.06197,
  title  = {MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer},
  author = {Dong Yao and Jieming Zhu and Jiahao Xun and Shengyu Zhang and Zhou Zhao and Liqun Deng and Wenqiao Zhang and Zhenhua Dong and Xin Jiang},
  journal= {arXiv preprint arXiv:2312.06197},
  year   = {2024}
}

备注

Short paper accepted by WWW 2024. This is revised and condensed based on the previous version titled "Music-PAW: Learning Music Representations via Hierarchical Part-whole Interaction and Contrast". For more experimental details and discussions, please refer to the original long paper at arXiv:2312.06197v1