基于可扩展合成数据与对抗域混淆的无标注自动音乐转录
声音
2024-07-04 v3 人工智能
音频与语音处理
摘要
自动音乐转录(AMT)是音乐信息处理领域的一项重要技术。尽管近年来机器学习技术提升了其性能,但当前方法通常仅在拥有大量标注数据的领域中获得高准确率。解决低资源或无资源领域的转录问题仍是一项未解的挑战。为解决此问题,我们提出了一种无需任何 MIDI-音频配对数据的转录模型,该模型利用可扩展的合成音频进行预训练,并使用未标注的真实音频进行对抗域混淆。在实验中,我们在训练数据集不包含目标数据域中音频的 MIDI 标注的真实应用场景下评估了该方法。尽管未使用任何真实的 MIDI-音频配对数据集,我们提出的方法仍取得了与现有基线方法相当的性能。此外,消融研究深入分析了该方法的可扩展性以及 AMT 研究领域未来面临的挑战。
引用
@article{arxiv.2312.10402,
title = {Annotation-free Automatic Music Transcription with Scalable Synthetic Data and Adversarial Domain Confusion},
author = {Gakusei Sato and Taketo Akama},
journal= {arXiv preprint arXiv:2312.10402},
year = {2024}
}
备注
7 pages, 1 figure, Accepted to 2024 IEEE International Conference on Multimedia and Expo (ICME)