中文

aTENNuate:基于深度状态空间模型在原始音频上的优化实时语音增强

声音 2025-06-17 v4 人工智能 机器学习 音频与语音处理

摘要

我们提出了 aTENNuate,这是一种简单的深度状态空间自编码器,配置为以端到端方式高效地进行在线原始语音增强。该网络的性能主要在原始语音去噪上进行评估,并在超分辨率和去量化等任务上进行额外评估。我们在 VoiceBank + DEMAND 和 Microsoft DNS1 合成测试集上对 aTENNuate 进行了基准测试。该网络在 PESQ 分数、参数量、MACs 和延迟方面优于以前的实时去噪模型。即使作为原始波形处理模型,该模型仍保持对干净信号的高保真度,且具有极少的可听伪影。此外,即使有噪输入被压缩至 4000Hz 和 4 bits,该模型仍保持有效性能,表明其在低资源环境中具备通用语音增强能力。可通过 pip install attenuate 进行尝试。

关键词

引用

@article{arxiv.2409.03377,
  title  = {aTENNuate: Optimized Real-time Speech Enhancement with Deep SSMs on Raw Audio},
  author = {Yan Ru Pei and Ritik Shrivastava and FNU Sidharth},
  journal= {arXiv preprint arXiv:2409.03377},
  year   = {2025}
}

备注

7 pages, 2 figures