中文

孪生 SIREN:基于隐式神经表示的音频压缩

声音 2023-06-23 v1 人工智能 机器学习 音频与语音处理

摘要

隐式神经表示(INRs)已成为一种颇具前景的表示多种数据模态的方法,包括三维形状、图像和音频。尽管近期研究已展示 INRs 在图像与三维形状压缩中的成功应用,其在音频压缩中的潜力仍基本未被探索。受此启发,我们提出一项关于使用 INRs 进行音频压缩的初步研究。我们的研究引入了孪生 SIREN(Siamese SIREN),一种基于流行 SIREN 架构的新方法。实验结果表明,与先前的 INR 架构相比,孪生 SIREN 在利用更少网络参数的同时实现了更优的音频重建保真度。

关键词

引用

@article{arxiv.2306.12957,
  title  = {Siamese SIREN: Audio Compression with Implicit Neural Representations},
  author = {Luca A. Lanzendörfer and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2306.12957},
  year   = {2023}
}

备注

Published as a workshop paper at ICML 2023 neural compression workshop