TripleC 学习与轻量语音增强用于多条件目标语音提取
音频与语音处理
2026-03-16 v2
摘要
在我们近期的工作中,我们提出了轻量语音增强引导目标语音提取(LGTSE),并证明了其在多说话人加噪声场景下的有效性。然而,真实世界的应用通常涉及更多样化和更复杂的条件,例如单说话人加噪声或双说话人无噪声。为应对这一挑战,我们通过一种跨条件一致性学习策略——即 TripleC 学习——扩展了 LGTSE。该策略首先在多说话人加噪声条件下进行验证,然后评估其在多样化场景中的泛化能力。此外,基于 LGTSE 中的轻量前端降噪器(该降噪器可以灵活处理含噪和纯净混合信号,并对未见条件展现出强泛化能力),我们将 TripleC 学习与一种所提出的并行通用训练方案相结合,该方案组织包含同一目标说话人的多个场景的批次。通过在不同条件下强制保持一致的提取,较简单的案例可以辅助较难的案例,从而充分利用多样化的训练数据并培养一个鲁棒的通用模型。在 Libri2Mix 三条件任务上的实验结果表明,所提出的结合 TripleC 学习的 LGTSE 优于特定条件模型,凸显了其在真实世界语音应用中通用部署的强大潜力。
引用
@article{arxiv.2512.04945,
title = {TripleC Learning and Lightweight Speech Enhancement for Multi-Condition Target Speech Extraction},
author = {Ziling Huang},
journal= {arXiv preprint arXiv:2512.04945},
year = {2026}
}
备注
in submisssion