中文

MuQ:基于Mel残差向量量化的自监督音乐表示学习

声音 2025-01-06 v2 人工智能 计算与语言 机器学习 音频与语音处理

摘要

近年来,随着基于自监督学习(SSL)的基础模型在各种音乐信息理解任务中取得成功,包括音乐标记、乐器分类、调性检测等。在本文中,我们提出了一种用于音乐理解的自监督音乐表示学习模型。与之前采用随机投影或现有神经编解码器的研究不同,本文提出的模型称为MuQ,旨在预测由Mel残差向量量化(Mel-RVQ)生成的标记。我们的Mel-RVQ利用残差线性投影结构进行Mel谱量化,以增强目标提取的稳定性和效率,从而实现更好的性能。实验表明,在多种下游任务上,MuQ仅需0.9K小时的开源预训练数据,便超越了以往的自监督音乐表示模型。通过将数据规模扩展到超过160K小时并采用迭代训练,模型性能持续提升。为进一步验证模型的强大性能,我们 presented MuQ-MuLan,这是一个基于对比学习的联合音乐文本嵌入模型,在MagnaTagATune数据集上的零样本音乐标记任务中实现了最先进的性能。代码和模型checkpoint均开源于https://github.com/tencent-ailab/MuQ。

关键词

引用

@article{arxiv.2501.01108,
  title  = {MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization},
  author = {Haina Zhu and Yizhi Zhou and Hangting Chen and Jianwei Yu and Ziyang Ma and Rongzhi Gu and Yi Luo and Wei Tan and Xie Chen},
  journal= {arXiv preprint arXiv:2501.01108},
  year   = {2025}
}