用于原始音乐生成的渐进式蒸馏扩散模型
声音
2023-07-21 v1 机器学习
音频与语音处理
摘要
本文旨在将一种新的深度学习方法应用于生成原始音频文件的任务。该方法基于扩散模型,一种近期的深度生成模型。这类新方法在图像生成中已展现出卓越成果,并受到计算机视觉界的广泛关注。另一方面,极少有研究关注其他类型的应用,例如波形域的音乐生成。本文实现了应用于音乐的无条件生成模型:采用一维 U-Net 的渐进式蒸馏扩散(Progressive distillation diffusion)。随后,给出了扩散不同参数及其在完整结果中取值的比较。通过本工作所实现的方法的一大优势在于,模型能够处理渐进式音频处理与生成,使用从 1 通道 128×384 到 3 通道 128×128 梅尔频谱图(mel-spectrograms)的变换以及循环生成。实证比较在多个自行收集的数据集上完成。
引用
@article{arxiv.2307.10994,
title = {Progressive distillation diffusion for raw music generation},
author = {Svetlana Pavlova},
journal= {arXiv preprint arXiv:2307.10994},
year = {2023}
}
备注
9 pages