中文

基于正负帧掩码对比学习的音乐表示

声音 2022-04-05 v2 机器学习 音频与语音处理

摘要

自监督学习,尤其是对比学习,为诸多深度学习研究领域的发展作出了卓越贡献。近期,声学信号处理领域的研究者注意到其成功,并利用对比学习以获取更优的音乐表示。典型地,现有方法最大化从同一音乐采样的两段失真音频片段间的相似性,即在音乐层面确保语义一致。然而,这些粗粒度方法忽略了帧级一些非必要或噪声元素,可能不利于模型学习音乐的有效表示。为此,本文提出一种基于对比学习框架、用于音乐表示的新型正负帧掩码方法,简称 PEMR。具体地,PEMR 引入正负掩码生成模块,利用 transformer 模块在 Log-Mel 频谱图上生成帧掩码。通过分别掩蔽重要成分或非必要成分,可生成自增强的负样本与正样本。我们设计了一种新型对比学习目标,以兼容从同一音乐采样的自增强正/负样本。我们在四个公开数据集上实验。音乐分类与翻唱歌曲识别这两项音乐相关下游任务的实验结果证明了 PEMR 所学音乐表示的泛化能力与可迁移性。

关键词

引用

@article{arxiv.2203.09129,
  title  = {Contrastive Learning with Positive-Negative Frame Mask for Music Representation},
  author = {Dong Yao and Zhou Zhao and Shengyu Zhang and Jieming Zhu and Yudong Zhu and Rui Zhang and Xiuqiang He},
  journal= {arXiv preprint arXiv:2203.09129},
  year   = {2022}
}

备注

Accepted by WWW2022