0.275kbps 高保真生成音频压缩
音频与语音处理
2026-02-03 v1 声音
摘要
在超低比特率下实现高保真通用音频压缩,对低带宽通信至生成式音频语言建模等应用至关重要。传统音频压缩方法和当代神经编解码器基本上是为波形重建而设计的。因此,在超低比特率下,这些方法衰减迅速,常常无法保留关键信息,导致严重的声学伪影和显著的语义失真。为克服这些限制,我们提出了生成式音频压缩(Generative Audio Compression, GAC),这是一种从信号保真度转向任务导向有效性的范式转变。在 AI Flow 框架中实现,GAC 基于信息容量定律理论。该理论认为,丰富的计算资源可在接收端用于抵消极端的通信瓶颈——体现了“更多计算,更少带宽”的哲学。通过在发送端集成语义理解,在接收端集成可扩展的生成式合成,GAC 将信息负担卸载到强大的模型先验中。我们的 18 亿参数模型实现了对 32kHz 通用音频的高保真重建,比特率达到前所未有的 0.275kbps。即便在 0.175kbps,仍能保持强大的可理解音频传输能力,这相当于约 3000 倍的压缩比,显著优于当前最先进的神经编解码器,在保持感知质量和语义一致性方面均表现出色。
引用
@article{arxiv.2602.00648,
title = {High-Fidelity Generative Audio Compression at 0.275kbps},
author = {Hao Ma and Ruihao Jing and Shansong Liu and Cheng Gong and Chi Zhang and Xiao-Lei Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2602.00648},
year = {2026}
}
备注
Technical Report