中文

DiffRoll:具有无监督预训练能力的基于扩散的生成式音乐转录

声音 2024-06-03 v2 人工智能 机器学习 音频与语音处理

摘要

本文提出了一种新颖的生成方法 DiffRoll,以解决自动音乐转录(AMT)问题。我们不将 AMT 视为训练模型将频谱图转换为钢琴卷帘的判别式任务,而是将其视为一个条件生成任务,训练我们的模型在以频谱图为条件的纯高斯噪声中生成逼真的钢琴卷帘。这种新的 AMT 表述使 DiffRoll 能够转录、生成甚至修复音乐。由于采用无分类器特性,DiffRoll 还能够在仅有钢琴卷帘可用的未配对数据集上进行训练。我们的实验表明,DiffRoll 比其判别式对应物高出 19 个百分点,并且我们的消融研究也表明它比现有的类似方法高出 4.8 个百分点。源代码和演示可在 https://sony.github.io/DiffRoll/ 获取。

关键词

引用

@article{arxiv.2210.05148,
  title  = {DiffRoll: Diffusion-based Generative Music Transcription with Unsupervised Pretraining Capability},
  author = {Kin Wai Cheuk and Ryosuke Sawata and Toshimitsu Uesaka and Naoki Murata and Naoya Takahashi and Shusuke Takahashi and Dorien Herremans and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2210.05148},
  year   = {2024}
}