HyperSound:利用超网络生成音频信号的隐式神经表示
声音
2024-01-26 v2 人工智能
机器学习
神经与进化计算
音频与语音处理
摘要
隐式神经表示(INRs)是一个快速发展的研究领域,为多媒体信号的表示提供了替代方法。INRs 近期的应用包括图像超分辨率、高维信号压缩或 3D 渲染。然而,这些方案通常聚焦于视觉数据,将其适配到音频领域并非易事。此外,每个数据样本都需要一个单独训练的模型。为应对这一局限,我们提出 HyperSound,一种利用超网络为训练时未见的音频信号生成 INRs 的元学习方法。我们展示了我们的方法能够以与其他最先进模型相当的质量重建声波。
引用
@article{arxiv.2211.01839,
title = {HyperSound: Generating Implicit Neural Representations of Audio Signals with Hypernetworks},
author = {Filip Szatkowski and Karol J. Piczak and Przemysław Spurek and Jacek Tabor and Tomasz Trzciński},
journal= {arXiv preprint arXiv:2211.01839},
year = {2024}
}
备注
NeurIPS 2022 MetaLearn workshop