中文

Presto!:加速音乐生成的步骤与层蒸馏

声音 2025-04-18 v2 人工智能 机器学习 音频与语音处理

摘要

尽管扩散基文本到音乐 (TTM) 方法取得了进展,但高质量且高效的生成仍是一个挑战。我们引入 Presto!,一种用于基于得分扩散转换器的推理加速的方法,通过减少采样步骤和每步的计算成本来实现加速。为减少步骤,我们开发了一种新的基于得分分布匹配蒸馏 (DMD) 方法,用于 EDM 系列扩散模型,这是 TTM 领域首个基于生成对抗网络 (GAN) 的蒸馏方法。为减少每步的计算成本,我们发展了一种简单但强大的改进方法,用于最近一种层蒸馏方法,通过更好地保留隐藏状态方差来提高学习效果。最终,我们将步骤蒸馏和层蒸馏方法结合起来,采用双管齐下的综合方法。我们分别独立评估了我们的步骤蒸馏和层蒸馏方法,证明它们均能实现最佳的性能。我们的组合蒸馏方法可实现高质量输出,同时提升多样性,将基础模型加速 10-18 倍 (32 秒单声道/立体声 44.1kHz 音频的延迟分别为 230/435ms,速度比当前最先进方法快 15 倍)— 这是我们所知的最快的高质量 TTM 方法。声音示例可在 https://presto-music.github.io/web/ 查看。

关键词

引用

@article{arxiv.2410.05167,
  title  = {Presto! Distilling Steps and Layers for Accelerating Music Generation},
  author = {Zachary Novack and Ge Zhu and Jonah Casebeer and Julian McAuley and Taylor Berg-Kirkpatrick and Nicholas J. Bryan},
  journal= {arXiv preprint arXiv:2410.05167},
  year   = {2025}
}

备注

Accepted as Spotlight at ICLR 2025