中文

MAGE:基于掩码生成模型的粗到细语音增强器

音频与语音处理 2026-03-16 v3 声音

摘要

语音增强由于效率与感知质量之间的权衡而具有挑战性。在本文中,我们引入了MAGE,即掩码音频生成增强器(Masked Audio Generative Enhancer),通过紧凑且鲁棒的设计推进了生成式语音增强。与先前使用随机掩码的掩码生成模型不同,MAGE采用一种感知稀缺性的粗到细掩码策略,在早期步骤中优先处理频繁token,在后期细化中处理稀有token,从而提高了效率和泛化能力。我们还提出了一种轻量级校正模块,通过检测低置信度预测并重新掩码进行细化,进一步稳定推理。基于BigCodec并从Qwen2.5-0.5B微调,MAGE通过选择性层保留减少至2亿参数。在DNS Challenge和噪声LibriSpeech上的实验表明,MAGE达到了最先进的感知质量,并显著降低了下游识别的词错误率,优于更大的基线模型。音频示例可在https://hieugiaosu.github.io/MAGE/获取。

关键词

引用

@article{arxiv.2509.19881,
  title  = {MAGE: A Coarse-to-Fine Speech Enhancer with Masked Generative Model},
  author = {The Hieu Pham and Tan Dat Nguyen and Phuong Thanh Tran and Joon Son Chung and Duc Dung Nguyen},
  journal= {arXiv preprint arXiv:2509.19881},
  year   = {2026}
}

备注

ICASSP 2026