从 KAN 到 GR-KAN:基于 KAN 方法论的语音增强突破
音频与语音处理
2025-05-22 v2 人工智能
机器学习
摘要
基于深度神经网络(DNN)的语音增强(SE)通常使用常规激活函数,这些函数缺乏捕捉高保真度 SE 所需复杂多尺度结构的表达能力。群-有理 KAN(GR-KAN)是 Kolmogorov-Arnold 网络(KAN)的一个变体,既保留了 KAN 的表达能力,又在复杂任务上提升了可扩展性。我们将 GR-KAN 应用于现有的 DNN-based SE 方法,通过在时频(T-F)域 MP-SENet 中的全连接层替换为 GR-KAN 层,并将 GR-KAN 的激活函数引入时域 Demucs 的 1D CNN 层中。在 Voicebank-DEMAND 数据集上实验表明,GR-KAN 参数数量可减少最高可达 4 倍,并将 PESQ 提升最高可达 0.1。相比之下,KAN 因可扩展性问题,在小规模信号建模任务中仅在 MLP 上有所优于,但未能改善 MP-SENet 的性能。我们首次成功地将 KAN 方法应用于时域和 SOTA TF 域 SE 中均能实现一致性提升,确立了 GR-KAN 作为 SE 领域的有前景的替代方案。
引用
@article{arxiv.2412.17778,
title = {From KAN to GR-KAN: Advancing Speech Enhancement with KAN-Based Methodology},
author = {Haoyang Li and Yuchen Hu and Chen Chen and Sabato Marco Siniscalchi and Songting Liu and Eng Siong Chng},
journal= {arXiv preprint arXiv:2412.17778},
year = {2025}
}
备注
Accepted to Interspeech2025