中文

基于薛定谔桥语音增强的鲁棒语音识别

音频与语音处理 2025-05-09 v1 声音

摘要

在这项工作中,我们研究了应用生成式语音增强来提高自动语音识别(ASR)模型在噪声和混响条件下的鲁棒性。我们采用了一个最近提出的基于薛定谔桥的语音增强模型,该模型已被证明相比基于扩散的方法表现良好。我们分析了模型缩放和不同采样方法对 ASR 性能的影响。此外,我们将所考虑的模型与预测性和基于扩散的基线模型进行了比较,并分析了使用不同预训练 ASR 模型时的语音识别性能。所提出的方法显著降低了词错误率,相对于未处理的语音信号降低了约 40%,相对于类似规模的预测性方法降低了约 8%。

关键词

引用

@article{arxiv.2505.04237,
  title  = {Robust Speech Recognition with Schr\"odinger Bridge-Based Speech Enhancement},
  author = {Rauf Nasretdinov and Roman Korostik and Ante Jukić},
  journal= {arXiv preprint arXiv:2505.04237},
  year   = {2025}
}

备注

5 pages. Published in ICASSP 2025