中文

FastWave:面向音频超分辨率的优化扩散模型

声音 2026-03-05 v1 机器学习

摘要

音频超分辨率是一套旨在以更高采样率估计给定信号的技术。其中包含扩散和流模型(被认为较慢)、生成对抗网络(被认为较快),但两种方法目前都由高参数网络实现,训练和推理都需要高计算成本。我们提出了一种解决方案,通过重新考虑最近在扩散模型训练方面的进展,将其应用于从任意样本率提升至48 kHz的超分辨率。我们的方法优于NU-Wave 2,与最先进的模型相当。我们的模型称为FastWave,具有约50 GFLOPs的计算复杂度和1.3百万参数,可使用更少的资源训练,并且比大多数最近提出的基于扩散和基于流的解决方案训练速度显著更快。代码已公开发布。

关键词

引用

@article{arxiv.2603.04122,
  title  = {FastWave: Optimized Diffusion Model for Audio Super-Resolution},
  author = {Nikita Kuznetsov and Maksim Kaledin},
  journal= {arXiv preprint arXiv:2603.04122},
  year   = {2026}
}