中文

DeFTAN-II:基于子组处理的高效多通道语音增强

音频与语音处理 2025-09-12 v1 信号处理

摘要

在本工作中,我们提出 DeFTAN-II,一种基于 transformer 架构与子组处理的高效多通道语音增强模型。尽管 transformer 在语音增强中取得了成功,但其在捕捉局部关系、降低高计算复杂度以及减少内存占用方面面临挑战。为解决这些局限,我们在模型中引入子组处理,将局部强调特征的子组与其他包含原始特征的子组相结合。子组处理在所提出网络的若干模块中实现。在提取空间特征的所提出拆分密集块中,一对子组被顺序拼接并由卷积层处理,以有效降低计算复杂度与内存占用。对于提取时域与频域关系的 F- 与 T-transformer,我们引入子组间的交叉注意力以识别局部强调与非强调特征间的关系。双路径前馈网络随后基于由膨胀卷积处理的局部特征的门控来聚合注意力特征。通过与最先进的多通道语音增强模型进行广泛比较,我们证明带有子组处理的 DeFTAN-II 以显著更低的计算复杂度优于现有方法。此外,我们在无微调的情况下于真实世界数据上评估了模型的泛化能力,进一步证明了其在实际场景中的有效性。

关键词

引用

@article{arxiv.2308.15777,
  title  = {DeFTAN-II: Efficient Multichannel Speech Enhancement with Subgroup Processing},
  author = {Dongheon Lee and Jung-Woo Choi},
  journal= {arXiv preprint arXiv:2308.15777},
  year   = {2025}
}

备注

13 pages, 6 figures, submitted to IEEE/ACM Trans. Audio, Speech, Lang. Process