中文

基于薛定谔桥的生成语音增强

音频与语音处理 2024-07-24 v1

摘要

本文提出一种基于薛定谔桥(Schrödinger bridge, SB)的生成语音增强模型。该模型采用可计算的 SB 来构建干净语音分布与观测噪声语音分布之间的数据-数据过程。模型以数据预测损失训练,旨在恢复复杂数值干净语音系数;同时引入辅助时域损失以改善模型训练。评估了两种语音增强任务:语音去噪与语音脱混响。实验结果表明,基于 SB 的模型在语音质量指标与语音识别器性能方面优于扩散模型,例如在去噪时相较于最佳基线模型实现 20% 的词错误率降低,在脱混响时实现 6% 的降低。该模型还显示出改进的效率,同等抽样步数下质量更好,计算成本更低。

关键词

引用

@article{arxiv.2407.16074,
  title  = {Schr\"odinger Bridge for Generative Speech Enhancement},
  author = {Ante Jukić and Roman Korostik and Jagadeesh Balam and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2407.16074},
  year   = {2024}
}