中文

I-DCCRN-VAE:面向单通道语音增强的改进深度表征学习框架

音频与语音处理 2026-02-03 v2

摘要

最近提出了一种基于 DCCRN 架构的复变变分自编码器(VAE)单通道语音增强系统。该系统中,噪声抑制 VAE(NSVAE)通过使用带有跳跃连接的预训练干净语音和噪声 VAE,从噪声语音中提取干净语音表征。本文通过引入三个关键修改来改进 DCCRN-VAE:1)移除预训练 VAE中的跳跃连接,以鼓励更具信息性的语音和噪声潜在表征;2)使用 β\beta-VAE 进行预训练,以更好地平衡重构和潜在空间正则化;3)NSVAE 生成两种语音和噪声潜在表征。实验表明,所提出的系统在匹配的 DNS3 数据集上表现与 DCCRN 和 DCCRN-VAE基线相当,但在不匹配数据集(WSJ0-QUT、Voicebank-DEMEND)上超越基线,显示出 improved 的泛化能力。此外,ablation 研究表明,使用经典微调而非对抗训练可实现类似性能, resulting in 更简单的训练管线。

关键词

引用

@article{arxiv.2510.12485,
  title  = {I-DCCRN-VAE: An Improved Deep Representation Learning Framework for Complex VAE-based Single-channel Speech Enhancement},
  author = {Jiatong Li and Simon Doclo},
  journal= {arXiv preprint arXiv:2510.12485},
  year   = {2026}
}

备注

Accepted by ICASSP2026