基于薛定谔桥的生成语音增强
音频与语音处理
2024-07-24 v1
摘要
本文提出一种基于薛定谔桥(Schrödinger bridge, SB)的生成语音增强模型。该模型采用可计算的 SB 来构建干净语音分布与观测噪声语音分布之间的数据-数据过程。模型以数据预测损失训练,旨在恢复复杂数值干净语音系数;同时引入辅助时域损失以改善模型训练。评估了两种语音增强任务:语音去噪与语音脱混响。实验结果表明,基于 SB 的模型在语音质量指标与语音识别器性能方面优于扩散模型,例如在去噪时相较于最佳基线模型实现 20% 的词错误率降低,在脱混响时实现 6% 的降低。该模型还显示出改进的效率,同等抽样步数下质量更好,计算成本更低。
引用
@article{arxiv.2407.16074,
title = {Schr\"odinger Bridge for Generative Speech Enhancement},
author = {Ante Jukić and Roman Korostik and Jagadeesh Balam and Boris Ginsburg},
journal= {arXiv preprint arXiv:2407.16074},
year = {2024}
}