中文

Dense-TSNet:面向超轻量语音增强的稠密连接双阶段结构

音频与语音处理 2024-09-19 v1 声音

摘要

语音增强旨在改善噪声环境下的语音质量和可理解性。近期研究聚焦于深度神经网络,尤其采用双阶段(TS)架构进行特征提取。然而,这些模型的复杂度和规模仍然是主要挑战,限制了其在资源受限场景中的应用。设计适用于边缘设备的模型自然存在技术难题。窄化轻量模型常因损失景观不均匀而遇到性能瓶颈。此外,Transformer 或 Mamba 等高级算子在实际部署中可能不具备卷积神经网络(CNN)的实用适应性和效率。为此,我们提出Dense-TSNet,一种创新的超轻量语音增强网络。我们的方法采用新颖的稠密双阶段(Dense-TS)架构,相较于经典双阶段架构,确保了后期训练阶段对目标函数的更稳健细化,从而提升最终性能,解决了基线模型的早期收敛局限问题。我们还引入多视角凝视模块(MVGB),通过卷积神经网络(CNN)融合全局、通道和局部视角,增强特征提取。此外,我们讨论了损失函数选择对感知质量的影响。Dense-TSNet 采用约14K参数的紧凑模型规模,展现出在资源受限环境中尤为适用的潜在性能。

关键词

引用

@article{arxiv.2409.11725,
  title  = {Dense-TSNet: Dense Connected Two-Stage Structure for Ultra-Lightweight Speech Enhancement},
  author = {Zizhen Lin and Yuanle Li and Junyu Wang and Ruili Li},
  journal= {arXiv preprint arXiv:2409.11725},
  year   = {2024}
}