中文

通过生成式预训练进行旋律转写

声音 2022-12-06 v1 人工智能 机器学习 多媒体 音频与语音处理

摘要

尽管旋律在音乐感知中扮演着核心角色,但在音乐信息检索中,可靠地检测任意音乐录音中存在的旋律音符仍是一项开放挑战。旋律转写的一个关键挑战是构建能够处理包含任意数量乐器组合与音乐风格的广泛音频的方法——现有策略对某些旋律乐器或风格有效,但并非全部。为应对这一挑战,我们利用 Jukebox (Dhariwal et al. 2020) 的表示,这是一个广泛音乐音频的生成模型,从而相对于传统谱图特征将旋律转写性能提升了 2020%。旋律转写的另一个障碍是缺乏训练数据——我们推导出一个新数据集,包含来自广泛音乐的众包标注的 5050 小时旋律转写。生成式预训练与该任务新数据集的结合,使得相对于最强可用基线,旋律转写性能提升了 7777%。通过将我们的新旋律转写方法与节拍检测、调性估计和和弦识别的解决方案配对,我们构建了 Sheet Sage,一个能够直接从音乐音频转写出人类可读主旋律谱的系统。音频示例见 https://chrisdonahue.com/sheetsage,代码见 https://github.com/chrisdonahue/sheetsage。

关键词

引用

@article{arxiv.2212.01884,
  title  = {Melody transcription via generative pre-training},
  author = {Chris Donahue and John Thickstun and Percy Liang},
  journal= {arXiv preprint arXiv:2212.01884},
  year   = {2022}
}

备注

Published as a conference paper at ISMIR 2022