PrimeK-Net:基于分组素数核卷积神经网络的多尺度频谱学习用于单通道语音增强
音频与语音处理
2025-02-28 v1 声音
摘要
单通道语音增强是一个具有挑战性的不适定问题,其目标是从退化信号中估计出干净的语音。已有研究表明,在语音增强任务中,将卷积神经网络(CNN)与Transformer相结合具有竞争力的性能。然而,现有框架未能充分解决计算效率问题,并且忽略了频谱的自然多尺度分布。此外,CNN在语音增强中的潜力尚未被完全发掘。为解决这些问题,本研究提出了深度可分离膨胀密集块(DSDDB)和分组素数核前馈通道注意力(GPFCA)模块。具体而言,DSDDB为现有框架的编码器/解码器引入了更高的参数和计算效率。GPFCA模块取代了Conformer的位置,以线性复杂度提取频谱的深层时间和频率特征。GPFCA利用所提出的分组素数核前馈网络(GPFN)来整合多粒度的长程、中程和短程感受野,同时利用素数的特性来避免周期性重叠效应。实验结果表明,本研究所提出的PrimeK-Net在VoiceBank+Demand数据集上达到了最先进的(SOTA)性能,仅用1.41M参数就达到了3.61的PESQ分数。
引用
@article{arxiv.2502.19906,
title = {PrimeK-Net: Multi-scale Spectral Learning via Group Prime-Kernel Convolutional Neural Networks for Single Channel Speech Enhancement},
author = {Zizhen Lin and Junyu Wang and Ruili Li and Fei Shen and Xi Xuan},
journal= {arXiv preprint arXiv:2502.19906},
year = {2025}
}
备注
This paper was accepeted by ICASSP 2025