中文

MERT:基于大规模自监督训练的声学音乐理解模型

声音 2024-12-30 v5 人工智能 计算与语言 机器学习 音频与语音处理

摘要

自监督学习(SSL)近来已成为在视觉、文本和语音领域大规模数据上训练可泛化模型的一种有前景的范式。尽管 SSL 已被证明在语音和音频中有效,但其在音乐音频上的应用尚待深入探索。这部分是由于建模音乐知识所带来的独特挑战,尤其是音乐的音调与音高特性。为填补这一研究空白,我们提出了一种基于大规模自监督训练的声学音乐理解模型(MERT),其在掩码语言建模(MLM)风格的声学预训练中引入教师模型以提供伪标签。在我们的探索中,我们确定了一种有效的教师模型组合,其在性能上优于传统的语音与音频方法。该组合包括基于残差矢量量化—变分自编码器(RVQ-VAE)的声学教师和基于常Q变换(CQT)的音乐教师。此外,我们探索了广泛的设置以克服声学语言模型预训练中的不稳定性,这使得我们设计的范式能够从 95M 扩展到 330M 参数。实验结果表明,我们的模型能够泛化并在 14 项音乐理解任务上表现良好,且取得了总体最优(SOTA)分数。

关键词

引用

@article{arxiv.2306.00107,
  title  = {MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training},
  author = {Yizhi Li and Ruibin Yuan and Ge Zhang and Yinghao Ma and Xingran Chen and Hanzhi Yin and Chenghao Xiao and Chenghua Lin and Anton Ragni and Emmanouil Benetos and Norbert Gyenge and Roger Dannenberg and Ruibo Liu and Wenhu Chen and Gus Xia and Yemin Shi and Wenhao Huang and Zili Wang and Yike Guo and Jie Fu},
  journal= {arXiv preprint arXiv:2306.00107},
  year   = {2024}
}

备注

accepted by ICLR 2024