中文

基于等响度阈值化与LSTM解码的钢琴转录增广拉格朗日方法

声音 2017-11-01 v3 神经与进化计算

摘要

自动音乐转录的一个核心目标是在音乐录音中检测单个音符事件。一个重要变体是依赖于乐器的音乐转录,其中方法可以使用所用乐器的校准数据。然而,尽管有额外信息,结果很少超过 80% 的 f-measure。作为一个可能的解释,转录问题可被证明是病态的,因此依赖于适当的正则化。最近提出的一种方法采用了简单凸正则化项(以稳定参数估计过程)与更复杂项(以鼓励更有意义的结构)的混合。本文中,我们提出该方法的两种扩展。首先,我们集成一个计算响度模型以更好区分真实与虚假音符检测。其次,我们采用(双向)长短期记忆网络来重新加权检测到的音符构型的似然。尽管简单,我们的两种扩展相比最先进技术导致了约 35% 的音符错误率下降。

关键词

引用

@article{arxiv.1707.00160,
  title  = {An Augmented Lagrangian Method for Piano Transcription using Equal Loudness Thresholding and LSTM-based Decoding},
  author = {Sebastian Ewert and Mark B. Sandler},
  journal= {arXiv preprint arXiv:1707.00160},
  year   = {2017}
}