中文

ZipEnhancer:基于双路径下采样-上采样的 Zipformer 用于单声道语音增强

声音 2025-01-10 v1 音频与语音处理

摘要

与其他建模隐藏层特征的三轴序列任务不同,双路径时间域和时频域语音增强模型有效且参数较少,但由于隐藏层特征具有四轴,导致计算密集。我们提出ZipEnhancer,即基于双路径下采样-上采样的 Zipformer 用于单声道语音增强,融合时间和频率域的下采样-上采样以降低计算成本。我们引入ZipformerBlock作为核心模块,提出Dual-Path DownSampleStacks的设计,实现对称的缩小与放大。我们还引入ScaleAdam优化器和Eden学习率调度器以进一步提升性能。本模型在DNS 2020挑战和Voicebank+DEMAND数据集上实现了新的状态突破,PER值分别达到3.69和3.63,使用204万参数和62.41G FLOPS,超越了在类似复杂度下其他方法。

关键词

引用

@article{arxiv.2501.05183,
  title  = {ZipEnhancer: Dual-Path Down-Up Sampling-based Zipformer for Monaural Speech Enhancement},
  author = {Haoxu Wang and Biao Tian},
  journal= {arXiv preprint arXiv:2501.05183},
  year   = {2025}
}

备注

Accepted by ICASSP 2025