中文

超网络构建声音的隐式神经表示

机器学习 2023-06-21 v3 人工智能 声音 音频与语音处理

摘要

隐式神经表示(INRs)现今被用于跨多种现实应用表示多媒体信号,包括图像超分辨率、图像压缩或3D渲染。现有利用INRs的方法主要聚焦于视觉数据,因为将其应用于音频等其他模态并非易事,原因在于基于图像的INR模型在架构属性中存在的归纳偏置。为应对此局限,我们引入HyperSound,这是首个为音频样本生成INRs的元学习方法,其利用超网络泛化至训练中所未见样本之外。我们的方法以与其他最先进模型相当的质量重建音频样本,并为深度神经网络中用于音频处理的当代声音表示(如谱图)提供了可行替代方案。

关键词

引用

@article{arxiv.2302.04959,
  title  = {Hypernetworks build Implicit Neural Representations of Sounds},
  author = {Filip Szatkowski and Karol J. Piczak and Przemysław Spurek and Jacek Tabor and Tomasz Trzciński},
  journal= {arXiv preprint arXiv:2302.04959},
  year   = {2023}
}

备注

ECML2023