中文

基准测试:全保真音频的无损压缩语言模型

声音 2026-03-10 v1 人工智能 机器学习 音频与语音处理

摘要

自回归“语言”模型(LM)可用于无损音频压缩,但以往工作仅限于8位音频,尚未探讨此类方法在实际场景(16/24位)下是否可行,或是否能与现有编解码器竞争。我们对全保真音频进行LM-based压缩基准测试,涵盖多种领域(音乐、语音、生物声学)、采样率(16kHz-48kHz)和位深(8、16、24位)。标准的样本级词汇化在更高位深下变得不可行,由于词汇表大小(16位为6.5万,24位为167万)。我们提出Trilobyte,一种用于全分辨率音频的字节级词汇化方案,使词汇规模从 O(2b)O(2^{b}) 降至 O(1)O(1),实现了首个可行的24位LM-based无损压缩。虽然LM持续优于FLAC,在8位和16位上实现了状态压缩,但随着位深超过8位,压缩收益增幅逐渐减小。

关键词

引用

@article{arxiv.2603.08683,
  title  = {Benchmarking Language Modeling for Lossless Compression of Full-Fidelity Audio},
  author = {Phillip Long and Zachary Novack and Chris Donahue},
  journal= {arXiv preprint arXiv:2603.08683},
  year   = {2026}
}

备注

Submitted for review at Interspeech 2026, 7 pages, 5 figures