中文

端到端真实世界复调钢琴音频到乐谱转录与分层解码

声音 2024-05-24 v1 人工智能 音频与语音处理

摘要

钢琴音频到乐谱转录(A2S)是一个重要但尚未充分探索的任务,在音乐创作、练习和分析中具有广泛的应用。然而,现有的端到端钢琴A2S系统在检索小节级信息(如调号和拍号)方面存在困难,并且仅使用合成数据进行训练和评估。为了解决这些限制,我们提出了一种具有分层解码器的序列到序列(Seq2Seq)模型,该模型与乐谱的分层结构对齐,通过多任务学习实现小节和音符级别的乐谱信息转录。为了弥合合成数据与人类演奏录音之间的差距,我们提出了一种两阶段训练方案,包括使用表现性演奏渲染(EPR)系统在合成音频上预训练模型,然后使用人类演奏录音对模型进行微调。为了保留用于乐谱重建的声部结构,我们提出了一种针对**Kern乐谱的预处理方法,适用于声部数量不受限制的场景。实验结果支持了我们提出的方法的有效性,无论是在合成音频数据上与当前最先进方法相比的转录性能,还是在人类录音上的首次实验。

关键词

引用

@article{arxiv.2405.13527,
  title  = {End-to-End Real-World Polyphonic Piano Audio-to-Score Transcription with Hierarchical Decoding},
  author = {Wei Zeng and Xian He and Ye Wang},
  journal= {arXiv preprint arXiv:2405.13527},
  year   = {2024}
}

备注

8 pages, 5 figures, accepted by IJCAI 2024 - AI, Arts & Creativity Track