D3RM:用于钢琴转录的离散去噪扩散精炼模型
声音
2025-01-14 v2 人工智能
机器学习
音频与语音处理
摘要
扩散模型因其在建模复杂数据分布方面的令人信服的性能而广泛应用于生成领域。此外,它们在判别任务(如图像分割)上也显示出有竞争力的结果。虽然扩散模型也已被探索用于自动音乐转录,但其性能尚未达到有竞争力的水平。在本文中,我们专注于离散扩散模型的精炼能力,并提出了一种用于钢琴转录的新颖架构。我们的模型利用邻域注意力层作为去噪模块,逐步预测目标高分辨率钢琴卷帘,以预训练声学模型的微调特征为条件。为了进一步增强精炼,我们设计了一种新颖的策略,在离散扩散模型的训练和推理阶段应用不同的转移状态。在MAESTRO数据集上的实验表明,我们的方法在F1分数上优于先前的基于扩散的钢琴转录模型和基线模型。我们的代码可在https://github.com/hanshounsu/d3rm获取。
引用
@article{arxiv.2501.05068,
title = {D3RM: A Discrete Denoising Diffusion Refinement Model for Piano Transcription},
author = {Hounsu Kim and Taegyun Kwon and Juhan Nam},
journal= {arXiv preprint arXiv:2501.05068},
year = {2025}
}
备注
Accepted to ICASSP 2025