中文

基于神经网络的多声部音乐转录整体方法

声音 2019-10-29 v1 机器学习 音频与语音处理 机器学习

摘要

我们提出了一种基于神经网络的框架,以端到端方式直接从多声部音频中提取乐谱。大多数先前的自动音乐转录(AMT)方法寻求音高的钢琴卷帘表示,随后可通过引入速度估计、节拍跟踪、调性估计或节奏量化将其转换为乐谱。与这些方法不同,我们的方法在单一阶段中直接从输入音频生成音乐记谱。为此,我们使用带有连接主义时序分类(CTC)损失函数的卷积循环神经网络(CRNN),其不需要音频帧与乐谱节奏信息之间的标注对齐。我们使用以不同速度和富有表现力的演奏合成的 Haydn、Mozart 和 Beethoven 弦乐四重奏以及 Bach 众赞歌作为输入来训练模型。输出是基于 **kern 格式的四声部音乐记谱的文本表示。尽管所提方法在一个简化场景中评估,结果显示该模型能够直接从音频信号学习转录乐谱,为完整的 AMT 开辟了有前景的途径。

关键词

引用

@article{arxiv.1910.12086,
  title  = {A holistic approach to polyphonic music transcription with neural networks},
  author = {Miguel A. Román and Antonio Pertusa and Jorge Calvo-Zaragoza},
  journal= {arXiv preprint arXiv:1910.12086},
  year   = {2019}
}

备注

Source code available at https://github.com/mangelroman/audio2score