中文

基于 Vocos 的快速灵活音频带宽扩展

音频与语音处理 2026-03-10 v1 机器学习 声音

摘要

我们提出了一种基于 Vocos 的带宽扩展模型,通过生成缺失的高频内容来提升 8-48 kHz 范围内的音频质量。输入信号被重采样至 48 kHz 并由神经声码器主干处理,从而实现单个网络支持任意上采样比例。轻量级基于 Linkwitz-Riley 的参考网络将原始低频段与生成的高频合并,通过平滑的交叉点实现。验证结果表明,该模型在保持竞争的对数谱距离的同时,在 NVIDIA A100 GPU 上实现 0.0001 的实时因子,在 8 核 CPU 上实现 0.0053 的实时因子,展示了在极端吞吐量下的实用性和高质量带宽扩展。

关键词

引用

@article{arxiv.2603.07285,
  title  = {Fast and Flexible Audio Bandwidth Extension via Vocos},
  author = {Yatharth Sharma},
  journal= {arXiv preprint arXiv:2603.07285},
  year   = {2026}
}

备注

5 pages, 2 figures, 5 tables. Submitted to INTERSPEECH 2026. Code available at https://github.com/ysharma3501/LavaSR.git