从判别模型到生成模型:音频超分辨率与带宽扩展综述
音频与语音处理
2026-05-20 v1 声音
信号处理
摘要
音频超分辨率(SR),也称为带宽扩展(BWE),旨在从低分辨率(LR)或带限(BL)观察中重建高保真信号,这是一项由于缺失高频(HF)内容的歧义性难题。本综述提供了全面概述,特别关注从判别映射向现代生成模型的范式转变。我们首先回顾了早期判别深度神经网络(DNN)模型,这些模型将 BWE/SR 公式化为确定性映射问题,容易出现回归到均值效应和谱平滑。我们随后系统性地回顾生成方法,包括自回归(AR)模型、变分自编码器(VAEs)、生成对抗网络(GANs)、扩散和基于评分的模型、流模型以及 Schrödinger 桥梁。在这些方法上,我们检查关键设计方面,包括表示域、架构、条件机制以及重建保真度、感知质量、鲁棒性和计算效率之间的权衡。此外,我们讨论了涉及大语言模型(LLMs)和多模态基础模型的新兴方向,强调在感知评估、相位建模和现实通用性方面的开放挑战。通过提供结构化分类和统一视角,本综述为从确定性点估计向分布感知生成模型推进 BWE/SR 建立了全面基础,为实际道路图提供了指导。
引用
@article{arxiv.2605.16681,
title = {A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models},
author = {Ningyuan Yang and Yize Li and Diego A. Cuji and Ryan M. Corey and Pu Zhao and Xue Lin and Andrew C. Singer},
journal= {arXiv preprint arXiv:2605.16681},
year = {2026}
}
备注
Under review