中文

基于音频条件U-Net的全页乐谱图像位置估计

机器学习 2019-10-17 v1 声音 音频与语音处理 机器学习

摘要

乐谱跟随的目标是在相应的乐谱表示中跟踪音乐表演(通常以音频形式)。现有方法主要依赖MIDI或MusicXML等计算机可读乐谱,并取得了稳健可靠的跟踪结果。近来,多模态深度学习方法已被用于在原始乐谱图像中跟随音乐表演。这些系统目前的局限之一是它们需要大量预处理步骤,将原始乐谱图像展开为单一的长谱表系统。当前工作尝试消除这一特定限制。我们提出了一种能够直接在未经处理的整页乐谱图像中估计匹配乐谱位置的架构。我们认为,这是迈向完全集成的乐谱跟随系统的必要第一步,该系统不依赖于任何预处理步骤,如光学音乐识别。

关键词

引用

@article{arxiv.1910.07254,
  title  = {Audio-Conditioned U-Net for Position Estimation in Full Sheet Images},
  author = {Florian Henkel and Rainer Kelz and Gerhard Widmer},
  journal= {arXiv preprint arXiv:1910.07254},
  year   = {2019}
}

备注

Accepted at International Workshop on Reading Music Systems 2019 (WoRMS)