中文

基于跨模态音乐表示学习的音频到符号化编曲

声音 2022-02-23 v2 机器学习 音频与语音处理

摘要

我们能否基于一首流行歌曲的音频自动推导出钢琴伴奏的乐谱?这正是本文所解决的音频到符号化编曲问题。一个好的编曲模型不仅应考虑音频内容,还应具备钢琴作曲的先验知识(从而使生成结果“听起来像”音频,同时保持音乐性)。为此,我们提出了一个跨模态表示学习模型,该模型 1)从音频中提取和弦与旋律信息,2)从音频和损坏的真实编曲中学习纹理表示。我们进一步引入了一种定制训练策略,逐步将纹理信息的来源从损坏的乐谱转移到音频。最终,基于乐谱的纹理后验退化为标准正态分布,推理时仅需音频。实验表明,我们的模型捕捉了主要音频信息,并在生成质量上优于基线方法。

关键词

引用

@article{arxiv.2112.15110,
  title  = {Audio-to-symbolic Arrangement via Cross-modal Music Representation Learning},
  author = {Ziyu Wang and Dejing Xu and Gus Xia and Ying Shan},
  journal= {arXiv preprint arXiv:2112.15110},
  year   = {2022}
}