基于噪声鲁棒潜在流匹配的高保真音频超分辨率 LatentFlowSR
声音
2026-04-13 v1
摘要
音频超分辨率旨在从带宽受限的低分辨率音频中恢复缺失的高频细节,从而提高重建信号的自然感和感知质量。然而,大多数现有方法直接在波形或时频域中操作,这不仅涉及高维生成空间,而且主要局限于语音任务,在更复杂的音频类型(如音效和音乐)方面仍有较大提升空间。为缓解这些限制,我们引入LatentFlowSR,这是一种新的音频超分辨率方法,利用潜在表示空间中的条件流匹配 (CFM)。具体而言,我们首先训练一个噪声鲁棒的自编码器,将低分辨率音频编码到连续的潜在空间中。以低分辨率潜在表示为条件,CFM机制通过一个一步常微分方程 (ODE) 求解器,从高斯先验逐步生成对应的高分辨率潜在表示。最终得到的高分辨率潜在表示被解码器解码,以重建高分辨率音频。实验结果表明,LatentFlowSR在各种音频类型和超分辨率设置下均优于基线方法。这些结果表明,所提出的方法具备强大的高频重建能力和稳健的泛化性能,为在音频超分辨率中采用潜在空间建模提供了有力的证据。相关代码将在论文审稿完成后公开。
引用
@article{arxiv.2604.09188,
title = {LatentFlowSR: High-Fidelity Audio Super-Resolution via Noise-Robust Latent Flow Matching},
author = {Fei Liu and Yang Ai and Hui-Peng Du and Yu-Fei Shi and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2604.09188},
year = {2026}
}