中文

用于改进 Onsets and Frames 音乐转录的对抗学习

声音 2019-06-21 v1 机器学习 音频与语音处理 机器学习

摘要

自动音乐转录被认为是音乐信息检索中最困难的问题之一,然而最近的深度学习方法在转录性能上取得了实质性改进。这些方法通常采用监督学习模型,通过最小化逐元素损失(如交叉熵函数)来预测各种时频表示。然而,以这种方式应用损失假定在给定输入下每个标签条件独立,因而无法准确表达标签间依赖。为解决这个问题,我们引入了一种直接在时频表示上操作并使输出分布更接近真实值的对抗训练方案。通过对抗学习,我们在帧级和音符级指标上均相对于 SOTA 音乐转录模型 Onsets and Frames 取得了一致改进。我们的结果表明,对抗学习能在提高模型估计置信度的同时显著降低错误率。我们的方法是通用的,适用于任何基于多标签预测的转录模型,而这类模型在音乐信号分析中非常常见。

关键词

引用

@article{arxiv.1906.08512,
  title  = {Adversarial Learning for Improved Onsets and Frames Music Transcription},
  author = {Jong Wook Kim and Juan Pablo Bello},
  journal= {arXiv preprint arXiv:1906.08512},
  year   = {2019}
}