使用 Transformer 检测音乐演奏错误
声音
2025-01-07 v1 人工智能
音频与语音处理
摘要
初学者音乐家常常难以识别其演奏中的具体错误,如演奏错误的音符或节奏。现有音乐错误检测工具存在两个局限:(1)现有方法依赖自动对齐,因此容易受到小偏差对齐目标所致的错误;(2)缺乏足够的数据来训练音乐错误检测模型,导致过度依赖启发式方法。为解决问题(1),我们提出了一种新型 Transformer 模型Polytune,接受音频输入并输出带注释的音乐谱分。该模型可端到端训练,通过潜在空间表示隐式对齐和比较演奏音频与音乐谱分。为解决问题(2),我们提出了一种新型数据生成技术,能够创建大规模合成音乐错误数据集。我们的方法在 14 种乐器上实现了 64.1% 的平均 Error Detection F1 分数,较先前工作提高了 40 个百分点。此外,我们的模型可处理多乐器,优于现有转化方法用于音乐错误检测。我们的源代码和数据集可在 https://github.com/ben2002chou/Polytune 获取。
引用
@article{arxiv.2501.02030,
title = {Detecting Music Performance Errors with Transformers},
author = {Benjamin Shiue-Hal Chou and Purvish Jajal and Nicholas John Eliopoulos and Tim Nadolsky and Cheng-Yun Yang and Nikita Ravi and James C. Davis and Kristen Yeon-Ji Yun and Yung-Hsiang Lu},
journal= {arXiv preprint arXiv:2501.02030},
year = {2025}
}
备注
AAAI 2025