中文

YourMT3+:基于增强变换器架构和跨数据集声乐增强的多乐器音乐转谱

音频与语音处理 2024-08-02 v3 机器学习 声音

摘要

多乐器音乐转谱旨在将多音乐乐录音转换为分配给每种乐器的音乐谱面。这一任务在建模时具有挑战性,因为需要同时识别多种乐器并转谱其音高与精确时序,且缺乏完整标注数据加剧了训练难度。本文引入 YourMT3+,一套基于近期语言标记解码方法 MT3 的增强型多乐器音乐转谱模型。我们采用层次化注意力变换器于时频域集成专家混合,以提升编码器性能。为解决数据限制,我们提出一种用于训练不完整标注的多通道解码方法,设计了声乐内部分置与跨声乐增强用于数据集混合。我们的实验表明,模型具备直接人声转谱能力,无需声乐分离预处理器。跨十个公开数据集的基准测试显示,我们的模型在性能上与现有转谱模型相当或更优。进一步在流行音乐录音上的测试则揭示了当前模型的局限性。完全可复现的代码和数据集已在 \url{https://github.com/mimbres/YourMT3} 上提供,并附有演示。

关键词

引用

@article{arxiv.2407.04822,
  title  = {YourMT3+: Multi-instrument Music Transcription with Enhanced Transformer Architectures and Cross-dataset Stem Augmentation},
  author = {Sungkyun Chang and Emmanouil Benetos and Holger Kirchhoff and Simon Dixon},
  journal= {arXiv preprint arXiv:2407.04822},
  year   = {2024}
}

备注

Accepted at IEEE International Workshop on Machine Learning for Signal Processing (MLSP) 2024, London