基于无声学流匹配的统一通用音频超分辨率
音频与语音处理
2026-02-06 v2 人工智能
声音
信号处理
摘要
本文提出了一个无声学框架,用于音频超分辨率,采用流匹配生成模型捕捉复杂复数谱系的条件分布。不同于传统两阶段扩散方法预测mel频谱图再依赖预训练神经声学器生成波形,本方法直接通过逆短时傅里叶变换(iSTFT)重构波形,从而消除对独立声学器的依赖。该设计不仅简化了端到端优化,还克服了两阶段管道中声学器性能限制的关键瓶颈。实验表明,模型在 diverse upsampling factors 下持续产生高保真48 kHz音频,在speech和general audio数据集上实现了最先进的性能。
引用
@article{arxiv.2510.00771,
title = {UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow Matching},
author = {Woongjib Choi and Sangmin Lee and Hyungseob Lim and Hong-Goo Kang},
journal= {arXiv preprint arXiv:2510.00771},
year = {2026}
}
备注
Accepted to ICASSP 2026