中文

基于Whisper方法的音频到乐谱转换模型

声音 2024-10-23 v1 计算与语言 机器学习 音频与语音处理

摘要

本论文开发了一个基于Whisper的Transformer模型,该模型从音乐音频中提取旋律和和弦,并将其记录为ABC记谱法。为ABC记谱法定制了全面的数据处理流程,包括数据清洗、格式化和转换,并实现了变异机制以增加训练数据的多样性和质量。本论文创新性地引入了“Orpheus乐谱”,这是一种自定义的记谱系统,将音乐信息转换为令牌,设计了自定义词汇库,并训练了相应的自定义分词器。实验表明,与传统算法相比,该模型的准确性和性能显著提高。在为音乐爱好者提供便捷的音频到乐谱工具的同时,这项工作也为音乐信息处理的研究提供了新的思路和工具。

关键词

引用

@article{arxiv.2410.17209,
  title  = {Audio-to-Score Conversion Model Based on Whisper methodology},
  author = {Hongyao Zhang and Bohang Sun},
  journal= {arXiv preprint arXiv:2410.17209},
  year   = {2024}
}

备注

5 pages, 7 figures