基于神经网络的多声部音乐转录整体方法
声音
2019-10-29 v1 机器学习
音频与语音处理
机器学习
摘要
我们提出了一种基于神经网络的框架,以端到端方式直接从多声部音频中提取乐谱。大多数先前的自动音乐转录(AMT)方法寻求音高的钢琴卷帘表示,随后可通过引入速度估计、节拍跟踪、调性估计或节奏量化将其转换为乐谱。与这些方法不同,我们的方法在单一阶段中直接从输入音频生成音乐记谱。为此,我们使用带有连接主义时序分类(CTC)损失函数的卷积循环神经网络(CRNN),其不需要音频帧与乐谱节奏信息之间的标注对齐。我们使用以不同速度和富有表现力的演奏合成的 Haydn、Mozart 和 Beethoven 弦乐四重奏以及 Bach 众赞歌作为输入来训练模型。输出是基于 **kern 格式的四声部音乐记谱的文本表示。尽管所提方法在一个简化场景中评估,结果显示该模型能够直接从音频信号学习转录乐谱,为完整的 AMT 开辟了有前景的途径。
引用
@article{arxiv.1910.12086,
title = {A holistic approach to polyphonic music transcription with neural networks},
author = {Miguel A. Román and Antonio Pertusa and Jorge Calvo-Zaragoza},
journal= {arXiv preprint arXiv:1910.12086},
year = {2019}
}
备注
Source code available at https://github.com/mangelroman/audio2score