中文

GPU 上的可微分时频散射

声音 2022-07-21 v4 机器学习 音频与语音处理

摘要

联合时频散射(JTFS)是时频域中的卷积算子,可提取不同速率与尺度下的谱时调制。它提供了初级听觉皮层中谱时感受野(STRF)的理想化模型,因而可作为孤立音频事件尺度上人类感知判断的生物学合理替代。然而,JTFS 与 STRF 的先前实现仍游离于感知相似性度量和音频生成评估方法的标准工具包之外。我们将此问题归因于三个局限:不可微分、速度慢和灵活性差。本文给出一种 Python 中的时频散射实现。与先前实现不同,我们的实现兼容 NumPy、PyTorch 和 TensorFlow 作为后端,因此可移植于 CPU 和 GPU。我们通过三个应用展示 JTFS 的效用:谱时调制的无监督流形学习、乐器监督分类以及生物声学声音的纹理重合成。

关键词

引用

@article{arxiv.2204.08269,
  title  = {Differentiable Time-Frequency Scattering on GPU},
  author = {John Muradeli and Cyrus Vahidi and Changhong Wang and Han Han and Vincent Lostanlen and Mathieu Lagrange and George Fazekas},
  journal= {arXiv preprint arXiv:2204.08269},
  year   = {2022}
}

备注

8 pages, 6 figures. Submitted to the International Conference on Digital Audio Effects (DAFX) 2022