中文

ReconVAT:面向低资源真实世界数据的半监督自动音乐转录框架

声音 2021-07-30 v2 机器学习 多媒体 音频与语音处理

摘要

当前大多数有监督自动音乐转录(AMT)模型缺乏泛化能力。这意味着它们难以转录来自多样音乐流派、且未出现在标注训练数据中的真实世界音乐录音。本文提出一种半监督框架 ReconVAT,通过利用大量可用的无标签音乐录音解决该问题。所提 ReconVAT 使用重构损失与虚拟对抗训练。当与现有用于 AMT 的 U-net 模型结合时,ReconVAT 在 MAPS 与 MusicNet 等常用基准数据集上取得具竞争力的结果。例如,在 MusicNet 弦乐部分的少样本设定下,ReconVAT 在音符级与带偏移音符级指标上分别取得 61.0% 与 41.6% 的 F1 分数,相较有监督基线模型分别提升 22.2% 与 62.5%。我们提出的框架还展示了在新数据上持续学习的潜力,这在不断有新数据可用的真实世界应用中颇具用处。

关键词

引用

@article{arxiv.2107.04954,
  title  = {ReconVAT: A Semi-Supervised Automatic Music Transcription Framework for Low-Resource Real-World Data},
  author = {Kin Wai Cheuk and Dorien Herremans and Li Su},
  journal= {arXiv preprint arXiv:2107.04954},
  year   = {2021}
}

备注

Accepted in ACMMM 21. Camera ready version