S-PRESSO:基于扩散自编码器与离线量化的超低比特声效压缩
声音
2026-02-24 v2 人工智能
多媒体
摘要
神经音频压缩模型最近实现了极端压缩率,使其能够高效地进行潜在生成建模。相反,已将潜在生成模型应用于压缩,推动了连续和离散方法的极限。然而,现有方法仍受限于低分辨率音频,在非常低的比特率时会出现显著退化, audible 伪影突出。在本文中,我们提出了 S-PRESSO,这是一个 48kHz 声效压缩模型,可在 0.096 kbps 以下生成连续和离散嵌入,通过离线量化实现。我们的模型依赖于预训练的潜在扩散模型来解码压缩后的音频嵌入。利用扩散解码器的生成性先验,我们实现了极低的帧率,最低可达 1Hz(750 倍压缩率),在保持逼真的重建质量的同时牺牲了精确保真度。尽管在高压缩率下运行,S-PRESSO 在音频质量、声学相似性和重建指标方面均优于连续和离散基线。
引用
@article{arxiv.2602.15082,
title = {S-PRESSO: Ultra Low Bitrate Sound Effect Compression With Diffusion Autoencoders And Offline Quantization},
author = {Zineb Lahrichi and Gaëtan Hadjeres and Gaël Richard and Geoffroy Peeters},
journal= {arXiv preprint arXiv:2602.15082},
year = {2026}
}