基于潜在桥接模型的音频超分辨率
声音
2026-01-01 v3 机器学习
摘要
音频超分辨率 (SR),即将低分辨率 (LR) 波形上采样为高分辨率 (HR) 版本,近期通过扩散模型和桥接模型进行探索,但以往方法常因其不可信息的生成先验而导致上采样质量次优。为实现高质量音频超分辨率,我们提出了一种新系统,采用潜在桥接模型 (LBM),将音频波形压缩到连续潜在空间中,并设计 LBM 以实现潜在到潜在的生成过程,这自然匹配 LR 到 HR 上采样过程,从而充分利用 LR 波形中包含的指令性先验信息。为进一步克服 HR 样本稀缺的限制,我们引入频率感知 LBM,作为模型输入将先验频率和目标频率纳入,从而使 LBM 能够在训练阶段显式学习任何到任何的上采样过程。此外,我们设计级联 LBM 并提出两种先验增强策略,首次实现音频上采样超 48 kHz 功能,提供无缝的级联 SR 流程,为音频后期制作提供更高的灵活性。全面实验结果评估于 VCTK、ESC-50、Song-Describer 基准数据集和两个内部测试集,表明我们在语音、音频和音乐信号上实现了任何到 48kHz SR 的最先进客观和感知质量,并首次记录了任何到 192kHz 音频 SR。演示地址:https://AudioLBM.github.io/。
引用
@article{arxiv.2509.17609,
title = {Audio Super-Resolution with Latent Bridge Models},
author = {Chang Li and Zehua Chen and Liyuan Wang and Jun Zhu},
journal= {arXiv preprint arXiv:2509.17609},
year = {2026}
}
备注
Accepted at NeurIPS 2025