中文

几乎无监督的音乐转录

声音 2026-05-26 v1 机器学习

摘要

竞争性的音乐转录模型需要大量的配对音频-乐谱数据,但由于收集成本、对齐困难和版权限制,这类数据稀缺。与此同时,大量未配对的音频录音和符号乐谱随时可得但未被利用。我们采用循环一致性翻译框架,少量配对数据作为最小锚点,充分释放未配对数据集的潜能。我们发现:在监督有限的情况下,未配对数据尤其重要,能带来显著提升;未配对音频的贡献大于未配对乐谱;在训练期间引入来自新乐器的无标签音频,能在无任何配对监督的情况下提升该乐器的转录效果。综上,这些结果表明,规模化未配对数据为数据稀缺乐器提供了实现高质量转录的实用路径。

关键词

引用

@article{arxiv.2605.24193,
  title  = {Music Transcription with (Almost) No Supervision},
  author = {Saebyeol Shin and Chao Wan and Zhenzhen Liu and Justin Lovelace and Daniel C. Lin and Kilian Q. Weinberger and John Thickstun},
  journal= {arXiv preprint arXiv:2605.24193},
  year   = {2026}
}