基于 Sigmoid 驱动的实时分带人声去噪
声音
2026-04-01 v1 人工智能
摘要
基于深度学习的实时人声去噪近年来取得了显著进展,展示了人工智能在保持语音自然度的同时提升信噪比 (SNR) 的能力。然而,许多深度学习方法存在高延迟且需要长时间的上下文,难以应用于现场应用。为解决这些挑战,我们提出一种基于谱损失训练的 Sigmoid 驱动理想比值掩模,以鼓励提高信噪比并最大化语音的感知质量。该模型采用带有频率注意力的分带编码器-解码器架构,总延迟小于 10 毫秒,在平稳噪声上实现 PESQ-WB 提升 0.21,在非平稳噪声上实现 PESQ-WB 提升 0.12。
引用
@article{arxiv.2603.29326,
title = {Real-Time Band-Grouped Vocal Denoising Using Sigmoid-Driven Ideal Ratio Masking},
author = {Daniel Williams},
journal= {arXiv preprint arXiv:2603.29326},
year = {2026}
}