中文

用于单通道语音增强的轻量级 Transformer 架构研究

音频与语音处理 2026-01-30 v1 声音

摘要

在语音增强中,在满足边缘设备计算约束的同时实现最先进(SotA)的性能仍然是一项艰巨的挑战。结合堆叠时序和频谱建模的网络有效地利用了诸如 Transformer 等改进的架构;然而,它们不可避免地会产生大量的计算复杂性和模型膨胀。通过对基于 Transformer 的时序和频谱建模进行系统的消融分析,我们证明采用精简的 Frequency-Time-Frequency (FTF) 堆叠 Transformer 架构能够在因果上下文中高效学习全局依赖关系,同时避免大量的计算需求。在训练中利用判别器进一步提高了学习效率和增强效果,而不会在推理期间引入额外的复杂性。所提出的具有对抗训练的轻量级、因果、基于 Transformer 的架构(LCT-GAN)在当代轻量级模型中的客观指标上达到了 SotA 性能,且开销远低得多。与 DeepFilterNet2 相比,LCT-GAN 仅需 6% 的参数,复杂度和性能相似。与 CCFNet+(Lite) 相比,LCT-GAN 节省了 9% 的参数和 10% 的乘加运算,同时性能得到提升。此外,LCT-GAN 甚至在广泛使用的测试数据集上优于更复杂的常见基线模型。

关键词

引用

@article{arxiv.2505.21057,
  title  = {Study of Lightweight Transformer Architectures for Single-Channel Speech Enhancement},
  author = {Haixin Zhao and Nilesh Madhu},
  journal= {arXiv preprint arXiv:2505.21057},
  year   = {2026}
}

备注

Accepted by EUSIPCO 2025