中文

基于掩码极化的语音增强测试时适应方法

音频与语音处理 2026-05-18 v1

摘要

适应语音增强 (SE) 模型以应对未见环境对于实际部署至关重要,但针对 SE 的测试时适应 (TTA) 仍 largely 未被探索,主要due于对 SE 模型在域迁移下如何退化缺乏理解。我们观察到,基于掩码的 SE 模型在域迁移时失去信心,预测的掩码变得平坦,丧失 decisive 的语音保留和噪声抑制能力。基于这一洞察,我们提出掩码极化 (MPol) 方法,通过 Wasserstein 距离进行分布比较,恢复掩码的双峰性。MPol 无需额外参数即可在训练模型之上运行,适用于资源受限的边缘部署。跨越 diverse 域迁移和网络结构的实验结果表明,MPol 在性能上实现了 very consistent 的提升,与显著更复杂的方法相比仍具竞争力。

关键词

引用

@article{arxiv.2601.14770,
  title  = {Test-Time Adaptation For Speech Enhancement Via Mask Polarization},
  author = {Tobias Raichle and Erfan Amini and Bin Yang},
  journal= {arXiv preprint arXiv:2601.14770},
  year   = {2026}
}

备注

Accepted at ICASSP 2026