孪生 SIREN:基于隐式神经表示的音频压缩
声音
2023-06-23 v1 人工智能
机器学习
音频与语音处理
摘要
隐式神经表示(INRs)已成为一种颇具前景的表示多种数据模态的方法,包括三维形状、图像和音频。尽管近期研究已展示 INRs 在图像与三维形状压缩中的成功应用,其在音频压缩中的潜力仍基本未被探索。受此启发,我们提出一项关于使用 INRs 进行音频压缩的初步研究。我们的研究引入了孪生 SIREN(Siamese SIREN),一种基于流行 SIREN 架构的新方法。实验结果表明,与先前的 INR 架构相比,孪生 SIREN 在利用更少网络参数的同时实现了更优的音频重建保真度。
引用
@article{arxiv.2306.12957,
title = {Siamese SIREN: Audio Compression with Implicit Neural Representations},
author = {Luca A. Lanzendörfer and Roger Wattenhofer},
journal= {arXiv preprint arXiv:2306.12957},
year = {2023}
}
备注
Published as a workshop paper at ICML 2023 neural compression workshop