自动音乐转录中的机器学习技术:系统综述
声音
2024-06-24 v1 人工智能
机器学习
音频与语音处理
摘要
在音乐信息检索(MIR)领域,自动音乐转录(AMT)作为将音频信号转换为符号记谱(如音符或乐谱)的核心挑战,凸显了其在音频信号分析中的重要地位。这一重要性主要源于音乐和声复杂且重叠的谱歌结构。通过全面审视现有在 AMT 中所使用的机器学习技术,我们探讨了当前模型和方法的进展与局限性。尽管取得了显著进展,但 AMT 系统尚未达到人类专家水平的准确率,这主要源于音乐和声的复杂性以及对细微解释的需求。本综述批判性地评估了全自动和半自动 AMT 系统,强调了最小化用户干预的重要性,并检讨了迄今为止提出的各种方法。通过解决先前技术的局限性并提出改进方向,我们的目标是引导未来研究 towards fully automated AMT systems,这些系统能够准确且高效地将复杂的音频信号转换为精确的符号表示。该研究不仅综合了最新的技术进展,还为克服 AMT 中的现有挑战绘制了道路图,为致力于缩小当前系统与人类水平转录准确率之间的差距的研究者提供了宝贵的见解。
引用
@article{arxiv.2406.15249,
title = {Machine Learning Techniques in Automatic Music Transcription: A Systematic Survey},
author = {Fatemeh Jamshidi and Gary Pike and Amit Das and Richard Chapman},
journal= {arXiv preprint arXiv:2406.15249},
year = {2024}
}