中文

极致保真:基于 KAN 的高保真音频表示

声音 2025-11-04 v3 计算机视觉与模式识别 音频与语音处理

摘要

隐式神经表示(INR)因能高效编码多媒体数据而备受关注,但其在音频信号领域的应用仍然有限。本研究引入 Kolmogorov-Arnold Network(KAN)作为一种使用可学习激活函数的新架构,将其作为音频表示的有效 INR 模型。KAN 展现出优于以往 INR 的感知性能,对于 1.5 s 音频实现了最低的 1.29 Log-SpectralDistance 和最高的 3.57 Perceptual Evaluation of Speech Quality。为扩展 KAN 的效用,我们提出了 FewSound,这是一种基于超网络的架构,用于增强 INR 参数更新。FewSound 优于最先进的 HyperSound,在 MSE 上提升了 33.3%,在 SI-SNR 上提升了 60.87%。这些结果表明 KAN 是一种稳健且适应性强的音频表示方法,具有可扩展并集成至各种超网络框架的潜力。源代码可在 https://github.com/gmum/fewsound.git 获取。

关键词

引用

@article{arxiv.2503.02585,
  title  = {As Good as It KAN Get: High-Fidelity Audio Representation},
  author = {Patryk Marszałek and Maciej Rut and Piotr Kawa and Przemysław Spurek and Piotr Syga},
  journal= {arXiv preprint arXiv:2503.02585},
  year   = {2025}
}

备注

Accepted to the 34th ACM International Conference on Information and Knowledge Management (CIKM '25)