中文

基于 Inception Depthwise 卷积和幅度感知线性注意力的轻量级 U-Net 语音增强方法 IMSE

声音 2025-12-02 v2 人工智能 计算机视觉与模式识别

摘要

在资源受限的设备上实现语音增强(SE)任务中的轻量化设计与高性能之间的平衡仍是一个重要挑战。现有领先方法如 MUSE 已通过引入多路径增强 Taylor(MET)变换和可变形嵌入(DE)建立了仅包含 0.51M 参数的强基准。然而,深入分析揭示了 MUSE 仍存在效率瓶颈:MET 模块依赖复杂的“近似-补偿”机制来缓解 Taylor 展开注意力的局限性,而可变形嵌入的偏移计算引入了额外的计算负担。本文提出 IMSE,一个系统优化且超轻量级网络。我们引入两个核心创新:1)用幅度感知线性注意力(MALA)取代 MET 模块。MALA 通过在注意力计算中显式保留查询向量的范数信息,从根本上纠正了“忽略�幅”问题,在无需辅助补偿分支的情况下实现了高效的全局建模。2)用 Inception Depthwise 卷积(IDConv)取代 DE 模块。IDConv 借鉴了 Inception 概念,将大卷积核操作分解为高效的平行分支(方形、水平和垂直条形),从而以极低的参数冗余捕获声谱特征。在 VoiceBank+DEMAND 数据集上的大量实验表明,与 MUSE 基准相比,IMSE 将参数数量显著减少 16.8%(从 0.513M 降至 0.427M),同时在 PESQ 指标(3.373)上实现了与领先方法相当的性能。这一研究为超轻量语音增强中的模型规模与语音质量之间的权衡设立了新基准。

关键词

引用

@article{arxiv.2511.14515,
  title  = {IMSE: Efficient U-Net-based Speech Enhancement using Inception Depthwise Convolution and Amplitude-Aware Linear Attention},
  author = {Xinxin Tang and Bin Qin and Yufang Li},
  journal= {arXiv preprint arXiv:2511.14515},
  year   = {2025}
}