aTENNuate:基于深度状态空间模型在原始音频上的优化实时语音增强
声音
2025-06-17 v4 人工智能
机器学习
音频与语音处理
摘要
我们提出了 aTENNuate,这是一种简单的深度状态空间自编码器,配置为以端到端方式高效地进行在线原始语音增强。该网络的性能主要在原始语音去噪上进行评估,并在超分辨率和去量化等任务上进行额外评估。我们在 VoiceBank + DEMAND 和 Microsoft DNS1 合成测试集上对 aTENNuate 进行了基准测试。该网络在 PESQ 分数、参数量、MACs 和延迟方面优于以前的实时去噪模型。即使作为原始波形处理模型,该模型仍保持对干净信号的高保真度,且具有极少的可听伪影。此外,即使有噪输入被压缩至 4000Hz 和 4 bits,该模型仍保持有效性能,表明其在低资源环境中具备通用语音增强能力。可通过 pip install attenuate 进行尝试。
引用
@article{arxiv.2409.03377,
title = {aTENNuate: Optimized Real-time Speech Enhancement with Deep SSMs on Raw Audio},
author = {Yan Ru Pei and Ritik Shrivastava and FNU Sidharth},
journal= {arXiv preprint arXiv:2409.03377},
year = {2025}
}
备注
7 pages, 2 figures