中文

基于无声学流匹配的统一通用音频超分辨率

音频与语音处理 2026-02-06 v2 人工智能 声音 信号处理

摘要

本文提出了一个无声学框架,用于音频超分辨率,采用流匹配生成模型捕捉复杂复数谱系的条件分布。不同于传统两阶段扩散方法预测mel频谱图再依赖预训练神经声学器生成波形,本方法直接通过逆短时傅里叶变换(iSTFT)重构波形,从而消除对独立声学器的依赖。该设计不仅简化了端到端优化,还克服了两阶段管道中声学器性能限制的关键瓶颈。实验表明,模型在 diverse upsampling factors 下持续产生高保真48 kHz音频,在speech和general audio数据集上实现了最先进的性能。

关键词

引用

@article{arxiv.2510.00771,
  title  = {UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow Matching},
  author = {Woongjib Choi and Sangmin Lee and Hyungseob Lim and Hong-Goo Kang},
  journal= {arXiv preprint arXiv:2510.00771},
  year   = {2026}
}

备注

Accepted to ICASSP 2026