中文

BridgeVoC:从恢复视角重塑神经语音合成器

声音 2025-11-11 v1

摘要

本文通过音频恢复的视角重新审视神经语音合成器任务,提出一种名为 BridgeVoC 的新型扩散语音合成器。具体而言,通过秩分析比较 Mel 谱与其他常见声学退化因素的秩特性,将语音合成器任务作为音频恢复的一种特殊情况来处理,其中目标谱的范围-空间 (RSS) 代理作为退化输入。基于此,我们引入 Schrodinger 桥框架用于扩散建模,该框架将 RSS 与目标谱定义为蒙特路托生成轨迹的双端点。进一步,为了充分利用时频 (T-F) 域中子带层次先验,我们精心设计了一种新型子带感知卷积扩散网络作为数据预测器,其中子带按不均匀策略划分,并采用大卷积核的卷积样式注意力模块进行高效的时频上下文建模。为实现单步推理,我们提出一种全向蒸馏损失,以促进教师模型到学生模型之间有效的信息传递,通过结合与目标相关的双射一致性损失提升性能。在多个基准数据集和离群数据集上进行了全面实验。定量和定性结果表明,虽然参数更少、计算成本更低、推理速度更具竞争力,但所提出的 BridgeVoC 在仅使用 4 个采样步骤的情况下,以 SOTA 水平超越现有基于 GAN、DDPM 和 flow-matching 的高级基线,并且在单步推理下仍实现优异性能。

关键词

引用

@article{arxiv.2511.07116,
  title  = {BridgeVoC: Revitalizing Neural Vocoder from a Restoration Perspective},
  author = {Andong Li and Tong Lei and Rilin Chen and Kai Li and Meng Yu and Xiaodong Li and Dong Yu and Chengshi Zheng},
  journal= {arXiv preprint arXiv:2511.07116},
  year   = {2025}
}

备注

18 pages, 16 figures