用于单通道语音增强的轻量级 Transformer 架构研究
音频与语音处理
2026-01-30 v1 声音
摘要
在语音增强中,在满足边缘设备计算约束的同时实现最先进(SotA)的性能仍然是一项艰巨的挑战。结合堆叠时序和频谱建模的网络有效地利用了诸如 Transformer 等改进的架构;然而,它们不可避免地会产生大量的计算复杂性和模型膨胀。通过对基于 Transformer 的时序和频谱建模进行系统的消融分析,我们证明采用精简的 Frequency-Time-Frequency (FTF) 堆叠 Transformer 架构能够在因果上下文中高效学习全局依赖关系,同时避免大量的计算需求。在训练中利用判别器进一步提高了学习效率和增强效果,而不会在推理期间引入额外的复杂性。所提出的具有对抗训练的轻量级、因果、基于 Transformer 的架构(LCT-GAN)在当代轻量级模型中的客观指标上达到了 SotA 性能,且开销远低得多。与 DeepFilterNet2 相比,LCT-GAN 仅需 6% 的参数,复杂度和性能相似。与 CCFNet+(Lite) 相比,LCT-GAN 节省了 9% 的参数和 10% 的乘加运算,同时性能得到提升。此外,LCT-GAN 甚至在广泛使用的测试数据集上优于更复杂的常见基线模型。
关键词
引用
@article{arxiv.2505.21057,
title = {Study of Lightweight Transformer Architectures for Single-Channel Speech Enhancement},
author = {Haixin Zhao and Nilesh Madhu},
journal= {arXiv preprint arXiv:2505.21057},
year = {2026}
}
备注
Accepted by EUSIPCO 2025