中文

用于语音增强的薛定谔桥一致性轨迹模型

声音 2025-07-17 v1 音频与语音处理

摘要

利用扩散模型的语音增强是一项极具前景的技术,可改善含噪语音数据中的语音质量。此外,薛定谔桥近期已被用于基于扩散的语音增强,通过解决前向过程终点与逆向过程起点之间的不匹配问题来提升语音质量。然而,由于获得高质量结果的推理需要大量的函数评估,SB 仍然存在推理缓慢的问题。虽然一致性模型通过在图像生成领域采用从预训练模型蒸馏的一致性训练解决了这一问题,但当步数增加时,它并不能提高生成质量。作为该问题的解决方案,一致性轨迹模型不仅加速了推理速度,还保持了质量与速度之间的良好折衷。此外,SoundCTM 证明了 CTM 技术在声音生成领域的适用性。在本文中,我们将 CTM 技术应用于薛定谔桥以进行语音增强,提出了薛定谔桥一致性轨迹模型。此外,我们在原始 CTM 的训练框架中引入了包含感知损失的全新辅助损失。结果表明,与传统的用于语音增强的薛定谔桥相比,SBCTM 在实时因子方面实现了约 16 倍的提升。此外,SBCTM 在质量和速度之间的良好折衷允许通过将多步细化限制在单步推理不足的情况下,从而实现高效的推理。我们的代码、预训练模型和音频样本可在 https://github.com/sony/sbctm/ 获取。

关键词

引用

@article{arxiv.2507.11925,
  title  = {Schr\"odinger Bridge Consistency Trajectory Models for Speech Enhancement},
  author = {Shuichiro Nishigori and Koichi Saito and Naoki Murata and Masato Hirano and Shusuke Takahashi and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2507.11925},
  year   = {2025}
}