中文

一种用于复音音符转写与多音高估计的轻量级乐器无关模型

声音 2022-05-13 v2 机器学习 音频与语音处理

摘要

自动音乐转写(AMT)已被认为是具有广泛应用的关键使能技术。鉴于该任务的复杂性,最佳结果通常来自针对特定设置的系统,例如乐器特定系统往往比乐器无关方法取得更好结果。类似地,若仅估计逐帧f0f_0值而忽略更难的音符事件检测,可获得更高精度。尽管精度很高,此类专用系统常无法部署于真实场景:存储与网络限制禁止使用多个专用模型,而内存与运行时间限制约束了其复杂度。本文提出一种轻量级神经网络用于乐器音乐转写,支持复音输出并可泛化至多种乐器(含人声)。我们的模型联合训练以预测逐帧起音、多音高与音符激活,实验表明该多输出结构提升了逐帧音符精度。尽管简单,基准结果显示本系统的音符估计明显优于可比基线,其逐帧精度仅略低于专用最先进AMT系统。我们希望借此鼓励学界进一步研究低资源、乐器无关的AMT系统。

关键词

引用

@article{arxiv.2203.09893,
  title  = {A Lightweight Instrument-Agnostic Model for Polyphonic Note Transcription and Multipitch Estimation},
  author = {Rachel M. Bittner and Juan José Bosch and David Rubinstein and Gabriel Meseguer-Brocal and Sebastian Ewert},
  journal= {arXiv preprint arXiv:2203.09893},
  year   = {2022}
}