基于 Vocos 的快速灵活音频带宽扩展
音频与语音处理
2026-03-10 v1 机器学习
声音
摘要
我们提出了一种基于 Vocos 的带宽扩展模型,通过生成缺失的高频内容来提升 8-48 kHz 范围内的音频质量。输入信号被重采样至 48 kHz 并由神经声码器主干处理,从而实现单个网络支持任意上采样比例。轻量级基于 Linkwitz-Riley 的参考网络将原始低频段与生成的高频合并,通过平滑的交叉点实现。验证结果表明,该模型在保持竞争的对数谱距离的同时,在 NVIDIA A100 GPU 上实现 0.0001 的实时因子,在 8 核 CPU 上实现 0.0053 的实时因子,展示了在极端吞吐量下的实用性和高质量带宽扩展。
引用
@article{arxiv.2603.07285,
title = {Fast and Flexible Audio Bandwidth Extension via Vocos},
author = {Yatharth Sharma},
journal= {arXiv preprint arXiv:2603.07285},
year = {2026}
}
备注
5 pages, 2 figures, 5 tables. Submitted to INTERSPEECH 2026. Code available at https://github.com/ysharma3501/LavaSR.git