中文

VoiceBridge:基于单步潜空间桥模型的全局语音恢复

声音 2026-03-11 v5 人工智能 音频与语音处理

摘要

桥模型已在语音增强领域得到研究,但大多局限于单任务,其全局语音恢复能力受限。在本工作中,我们提出了 VoiceBridge,一种用于 GSR 的单步潜空间桥模型(LBM),能够从各种失真中高效重建 48 kHz 全频带语音。为继承数据域桥模型的优势,我们设计了一种保能变分自编码器,增强了不同能量水平下的波形-潜空间对齐。通过将波形压缩为连续的潜表示,VoiceBridge 以由可扩展 Transformer 支持的单一潜到潜生成过程对各种 GSR 任务进行建模。为缓解从显著不同的低质量先验中重建高质量目标的挑战,我们提出了一种用于 GSR 的联合神经先验,在多样任务中统一减轻了 LBM 的负担。基于这些设计,我们通过联合调优 LBM、解码器和判别器进一步研究了桥训练目标,将模型从去噪器转变为生成器,并实现了无需蒸馏的单步 GSR。跨领域内(如去噪和超分辨率)和领域外任务(如优化合成语音)及数据集的广泛验证表明了 VoiceBridge 的优越性能。演示:https://VoiceBridgedemo.github.io/。

关键词

引用

@article{arxiv.2509.25275,
  title  = {VoiceBridge: General Speech Restoration with One-step Latent Bridge Models},
  author = {Chi Zhang and Kaiwen Zheng and Zehua Chen and Jun Zhu},
  journal= {arXiv preprint arXiv:2509.25275},
  year   = {2026}
}