使用自回归多状态音符模型的复调钢琴转录
音频与语音处理
2020-10-05 v1 机器学习
声音
摘要
近期复调钢琴转录的进展主要源于精心设计的神经网络架构,其检测不同音符状态(如起音或延音)并对状态的时间演化建模。然而,其中多数对每种音符状态使用分离的神经网络,从而优化多个损失函数,并借助状态间神经网络的抽象连接或后处理模块来处理音符状态的时间演化。本文提出一种统一神经网络架构,将多个音符状态作为softmax输出以单一损失函数预测,并通过网络内部的自回归连接学习时间顺序。该紧凑模型可在不增加架构复杂度的前提下增加音符状态。利用MAESTRO数据集,我们考察了包含on、onset、sustain、re-onset、offset与off的多种音符状态组合。我们还展示了自回归模块能有效学习音符的状态间依赖。最后,我们表明所提模型以更少参数取得了与最优方法相当的性能。
引用
@article{arxiv.2010.01104,
title = {Polyphonic Piano Transcription Using Autoregressive Multi-State Note Model},
author = {Taegyun Kwon and Dasaem Jeong and Juhan Nam},
journal= {arXiv preprint arXiv:2010.01104},
year = {2020}
}
备注
6+2 pages, 5 figures, Camera-ready version. To be published in ISMIR 2020. Project page is available at https://TaegyunKwon.github.io/ar_multi_transcription