一种用于复音音符转写与多音高估计的轻量级乐器无关模型
声音
2022-05-13 v2 机器学习
音频与语音处理
摘要
自动音乐转写(AMT)已被认为是具有广泛应用的关键使能技术。鉴于该任务的复杂性,最佳结果通常来自针对特定设置的系统,例如乐器特定系统往往比乐器无关方法取得更好结果。类似地,若仅估计逐帧值而忽略更难的音符事件检测,可获得更高精度。尽管精度很高,此类专用系统常无法部署于真实场景:存储与网络限制禁止使用多个专用模型,而内存与运行时间限制约束了其复杂度。本文提出一种轻量级神经网络用于乐器音乐转写,支持复音输出并可泛化至多种乐器(含人声)。我们的模型联合训练以预测逐帧起音、多音高与音符激活,实验表明该多输出结构提升了逐帧音符精度。尽管简单,基准结果显示本系统的音符估计明显优于可比基线,其逐帧精度仅略低于专用最先进AMT系统。我们希望借此鼓励学界进一步研究低资源、乐器无关的AMT系统。
引用
@article{arxiv.2203.09893,
title = {A Lightweight Instrument-Agnostic Model for Polyphonic Note Transcription and Multipitch Estimation},
author = {Rachel M. Bittner and Juan José Bosch and David Rubinstein and Gabriel Meseguer-Brocal and Sebastian Ewert},
journal= {arXiv preprint arXiv:2203.09893},
year = {2022}
}