中文

SuPseudo:一种用于远场语音识别中神经语音增强的伪监督学习方法

声音 2025-06-24 v2 音频与语音处理

摘要

由于真实录制的远场对话数据集缺乏目标语音标注,语音增强(SE)模型通常在模拟数据上训练。然而,训练好的模型在真实条件下往往表现不佳,阻碍了其在远场语音识别中的应用。为了解决这一问题,我们 提出直接声音估计(DSE),用于估计真实录制数据的oracle直接声音以进行SE; 提出一种新颖的伪监督学习方法SuPseudo,利用DSE估计作为伪标签,使SE模型能够直接从真实录制数据中学习并适应,从而提高其泛化能力。此外,设计了一个名为FARNET的SE模型以充分利用SuPseudo。在MISP2023语料库上的实验证明了SuPseudo的有效性,且我们的系统显著优于之前的state-of-the-art。我们的方法演示可在https://EeLLJ.github.io/SuPseudo/ 找到。

关键词

引用

@article{arxiv.2505.24450,
  title  = {SuPseudo: A Pseudo-supervised Learning Method for Neural Speech Enhancement in Far-field Speech Recognition},
  author = {Longjie Luo and Lin Li and Qingyang Hong},
  journal= {arXiv preprint arXiv:2505.24450},
  year   = {2025}
}

备注

Accepted by InterSpeech 2025