基于可扩展交替方向框架的录音室钢琴转录
声音
2016-09-05 v2 数值分析
摘要
给定一段音乐音频录音,自动音乐转录的目标是确定该录音所对应乐曲的乐谱式表示。尽管研究界对此兴趣浓厚,但多项研究报告了一种“玻璃天花板”效应,即当前方法似乎无法克服的转录精度上限。本文探讨了通过专注于特定乐器类别并利用录音室或家庭录音场景中可用的录音条件附加信息,能在多大程度上缓解这一效应。具体而言,利用所使用乐器的单音录音,我们开发了一种新颖的信号模型,该模型以可变长度的频谱-时间模式为核心构建模块,专为钢琴等有音高打击乐器量身定制。模型对频谱模板之间的时间依赖性进行建模,具有阶乘缩放隐马尔可夫模型(FS-HMM)以及结合非负矩阵分解与马尔可夫过程的其他方法的特征。与FS-HMM相比,我们的参数估计是在可扩展交替方向乘子法(ADMM)框架内以一种全局、松弛的形式开发的,这使得能够将传播音符活动中稀疏性和局部平稳性的基本正则化子与施加时间语义的更复杂正则化子系统地结合起来。在雅马哈Disklavier(MAPS DB)上录制的乐曲上,所提方法对音符起始点的f-measure达到了93-95%。
引用
@article{arxiv.1606.00785,
title = {Piano Transcription in the Studio Using an Extensible Alternating Directions Framework},
author = {Sebastian Ewert and Mark Sandler},
journal= {arXiv preprint arXiv:1606.00785},
year = {2016}
}
备注
IEEE/ACM Transactions on Audio, Speech, and Language Processing