ReconVAT:面向低资源真实世界数据的半监督自动音乐转录框架
声音
2021-07-30 v2 机器学习
多媒体
音频与语音处理
摘要
当前大多数有监督自动音乐转录(AMT)模型缺乏泛化能力。这意味着它们难以转录来自多样音乐流派、且未出现在标注训练数据中的真实世界音乐录音。本文提出一种半监督框架 ReconVAT,通过利用大量可用的无标签音乐录音解决该问题。所提 ReconVAT 使用重构损失与虚拟对抗训练。当与现有用于 AMT 的 U-net 模型结合时,ReconVAT 在 MAPS 与 MusicNet 等常用基准数据集上取得具竞争力的结果。例如,在 MusicNet 弦乐部分的少样本设定下,ReconVAT 在音符级与带偏移音符级指标上分别取得 61.0% 与 41.6% 的 F1 分数,相较有监督基线模型分别提升 22.2% 与 62.5%。我们提出的框架还展示了在新数据上持续学习的潜力,这在不断有新数据可用的真实世界应用中颇具用处。
引用
@article{arxiv.2107.04954,
title = {ReconVAT: A Semi-Supervised Automatic Music Transcription Framework for Low-Resource Real-World Data},
author = {Kin Wai Cheuk and Dorien Herremans and Li Su},
journal= {arXiv preprint arXiv:2107.04954},
year = {2021}
}
备注
Accepted in ACMMM 21. Camera ready version