中文

LORT:基于局部细化卷积和Taylor Transformer的单声道语音增强

音频与语音处理 2025-09-30 v1 声音

摘要

在语音增强领域,实现卓越的增强性能同时保持低参数数量和计算复杂度仍是挑战。本文引入LORT,一种新型架构,将空间-通道增强的Taylor Transformer与局部细化卷积相结合,用于高效且稳健的语音增强。我们提出了基于Taylor多头自注意力(T-MSA)模块的空间-通道增强注意力(SCEA),旨在促进跨通道信息交换,缓解基于Taylor的Transformer在空间注意力方面的局限。为补充全局建模,我们进一步提出局部细化卷积(LRC)模块,将卷积前馈层、时频密集局部卷积和门控单元整合,以捕获细粒度的局部细节。基于类似U-Net的编码器-解码器结构,LORT仅在编码器中使用16个输出通道,通过交替的下采样和上采样操作在多分辨率T-MSA模块中处理带噪输入。增强后的幅度谱和相位谱分别独立解码,并通过综合损失函数优化,该损失函数同时考虑幅度、复数、相位、判别器和一致性目标。在VCTK+DEMAND和DNS Challenge数据集上的实验结果表明,LORT在参数仅为0.96M的情况下实现了对比最先进(SOTA)模型的竞争或更优性能,凸显其在资源有限的实际语音增强应用中的有效性。

关键词

引用

@article{arxiv.2509.23832,
  title  = {LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement},
  author = {Junyu Wang and Zizhen Lin and Tianrui Wang and Meng Ge and Longbiao Wang and Jianwu Dang},
  journal= {arXiv preprint arXiv:2509.23832},
  year   = {2025}
}

备注

Speech Communication