超网络构建声音的隐式神经表示
机器学习
2023-06-21 v3 人工智能
声音
音频与语音处理
摘要
隐式神经表示(INRs)现今被用于跨多种现实应用表示多媒体信号,包括图像超分辨率、图像压缩或3D渲染。现有利用INRs的方法主要聚焦于视觉数据,因为将其应用于音频等其他模态并非易事,原因在于基于图像的INR模型在架构属性中存在的归纳偏置。为应对此局限,我们引入HyperSound,这是首个为音频样本生成INRs的元学习方法,其利用超网络泛化至训练中所未见样本之外。我们的方法以与其他最先进模型相当的质量重建音频样本,并为深度神经网络中用于音频处理的当代声音表示(如谱图)提供了可行替代方案。
引用
@article{arxiv.2302.04959,
title = {Hypernetworks build Implicit Neural Representations of Sounds},
author = {Filip Szatkowski and Karol J. Piczak and Przemysław Spurek and Jacek Tabor and Tomasz Trzciński},
journal= {arXiv preprint arXiv:2302.04959},
year = {2023}
}
备注
ECML2023