Bridge-SR:基于薛定谔桥的高效语音超分辨率
声音
2025-01-15 v1 音频与语音处理
摘要
语音超分辨率(SR)是从低分辨率波形生成高采样率波形的长期存在的关键任务。以往的工作在不同数据空间中探索了语音SR,但这些方法要么需要额外的压缩网络,要么合成质量和推理速度有限。鼓励的是近期概率生成模型的进展。我们提出了Bridge-SR,这是一种基于可计算薛定谔桥模型的新型且高效的任意48kHz SR系统,工作于语音波形域。通过利用观察到的低分辨率波形作为先验(在高分辨率目标方面具有内在信息),我们利用优化轻量级网络来学习从先验到目标的得分函数,通过数据到数据的数据生成过程实现高效的波形SR,充分利用低分辨率观察中所包含的指令性内容。此外,我们确定了噪声计划、数据缩放和辅助损失函数的重要性,这些因素进一步提高了基于桥接的系统SR质量。在VCTK基准数据集上的实验表明,我们的系统具有:(1)在样本质量方面,Bridge-SR在不同SR设置下超过了几个强大的基线方法,采用轻量级网络主干(1.7M参数);(2)在推理速度方面,我们的4步合成的表现优于8步条件扩散方法(LSD: 0.911 vs 0.927)。演示地址:https://bridge-sr.github.io。
引用
@article{arxiv.2501.07897,
title = {Bridge-SR: Schr\"odinger Bridge for Efficient SR},
author = {Chang Li and Zehua Chen and Fan Bao and Jun Zhu},
journal= {arXiv preprint arXiv:2501.07897},
year = {2025}
}
备注
Accepted at ICASSP 2025