中文

用多分辨率神经网络拟合听觉滤波器组

声音 2024-07-09 v1 人工智能 机器学习 音频与语音处理 泛函分析

摘要

基于波形的深度学习面临非参数与参数化方法之间的两难困境。一方面,卷积神经网络(convnets)可逼近任意线性时不变系统;然而在实践中,其频率响应随着感受野增大而变得愈发不规则。另一方面,诸如 LEAF 这样的参数化模型保证产生 Gabor 滤波器,从而获得最优的时频局部化;然而,这种强归纳偏置以牺牲表示能力为代价。本文旨在通过引入一种名为多分辨率神经网络(MuReNN)的神经音频模型来克服该困境。MuReNN 的核心思想是在离散小波变换(DWT)的倍频程子带上分别训练卷积算子。由于 DWT 原子的尺度在倍频程之间呈指数增长,MuReNN 中后续可学习卷积的感受野也随之扩张。对于给定的真实世界数据集,我们将 MuReNN 的幅频响应拟合到成熟的听觉滤波器组:分别为语音的 Gammatone、音乐的 CQT 以及城市声音的倍频程三分之一滤波器组。这是一种知识蒸馏(KD)形式,其中滤波器组“教师”由领域知识设计,而神经网络“学生”从数据中优化。我们在留出集上 KD 后的拟合优度以及 Heisenberg 时频局部化方面,将 MuReNN 与现有最优方法进行比较。相较于 convnets 与 Gabor 卷积,我们发现 MuReNN 在这三个优化问题上均达到了最优性能。

关键词

引用

@article{arxiv.2307.13821,
  title  = {Fitting Auditory Filterbanks with Multiresolution Neural Networks},
  author = {Vincent Lostanlen and Daniel Haider and Han Han and Mathieu Lagrange and Peter Balazs and Martin Ehler},
  journal= {arXiv preprint arXiv:2307.13821},
  year   = {2024}
}

备注

4 pages, 4 figures, 1 table, conference