用于乐谱跟随的多模态条件边界框回归
声音
2021-05-11 v1 机器学习
音频与语音处理
摘要
本文研究基于乐谱图像的在线音频到乐谱对齐问题,也称为乐谱跟随。受目标检测启发,我们提出一种条件神经网络架构,对于给定的音乐演奏,在每一时间点上直接预测完整乐谱图像中匹配位置的 x,y 坐标。实验在一个合成复调钢琴基准数据集上进行,并将新方法与文献中若干现有的基于乐谱图像的乐谱跟随方法以及一个光学音乐识别基线进行比较。所提方法取得了新的 SOTA 结果,并且通过应用脉冲响应作为数据增强技术,在一组真实世界钢琴录音上显著提升了对齐性能。
引用
@article{arxiv.2105.04309,
title = {Multi-modal Conditional Bounding Box Regression for Music Score Following},
author = {Florian Henkel and Gerhard Widmer},
journal= {arXiv preprint arXiv:2105.04309},
year = {2021}
}
备注
Accepted for publication in the Proceedings of the 29th European Signal Processing Conference (EUSIPCO), Dublin, Ireland, 2021