中文

面向嘈杂多说话人场景的轻量级语音增强引导目标语音提取

音频与语音处理 2026-03-16 v2

摘要

目标语音提取(TSE)在相对简单的条件下(如单说话人加噪声和双说话人混合)已取得强劲性能,但在嘈杂的多说话人场景中其性能仍不理想。为解决这一问题,我们引入一种轻量级语音增强模型 GTCRN,以更好地引导 TSE 在嘈杂环境中的表现。基于我们此前具有竞争力的无说话人嵌入/编码器框架 SEF-PNet,我们提出两项扩展:LGTSE 和 D-LGTSE。LGTSE 通过在 enrollment 语音的上下文交互之前对输入含噪语音进行去噪,引入噪声无关的 enrollment 引导,从而降低噪声干扰。D-LGTSE 进一步通过利用去噪语音作为训练过程中的额外含噪输入来提升系统对语音失真的鲁棒性,扩展了嘈杂条件的动态范围,使模型能够直接从失真信号中学习。此外,我们提出两阶段训练策略,首先进行 GTCRN 增强引导的预训练,然后进行联合微调,以充分挖掘模型潜力。在 Libri2Mix 数据集上的实验表明 SISDR 提升 0.89 dB,PESQ 提升 0.16,STOI 提升 1.97%,验证了我们方法的有效性。

关键词

引用

@article{arxiv.2508.19583,
  title  = {Lightweight speech enhancement guided target speech extraction in noisy multi-speaker scenarios},
  author = {Ziling Huang and Junnan Wu and Lichun Fan and Zhenbo Luo and Jian Luan and Haixin Guan and Yanhua Long},
  journal= {arXiv preprint arXiv:2508.19583},
  year   = {2026}
}

备注

Submitted to Computer Speech & Language