中文

基于Mamba状态空间模型和稀疏N-gram上下文混合的在线无损压缩

机器学习 2026-05-06 v1 信息论 math.IT

摘要

我们提出了StateSMix,一个完全自包含的无损压缩器,将在线训练的Mamba风格状态空间模型(SSM)与稀疏N-gram上下文混合相结合。该模型从零初始化并对正在压缩的文件进行逐词训练,无需预训练权重、GPU或外部依赖。SSM(DM=32,NL=2,约120K active参数/文件)提供对BPE词的持续更新概率估计,而九个稀疏N-gram哈希表(从bigram到32-gram,每个16M插槽)通过softmax不变的logit偏置机制添加对exact local和long-range pattern记忆,仅更新非零计数词。熵自适应缩放机制根据SSM的预测置信度调制N-gram贡献,防止神经模型已校准时出现过度纠正。在标准enwik8基准测试中,StateSMix在1MB、3MB和10MB上的分别实现了2.123 bpb、2.149 bpb和2.162 bpb,分别比xz -9e(LZMA2)提高了8.7%、5.4%和0.7%。消融实验确立了SSM为主要压缩引擎:它alone account for了46.6%的size reduction,超过了基于频率计数的基线,同时在没有任何N-gram组件的情况下也胜过xz,而N-gram表通过exact context记忆提供了补充的4.1%提升。OpenMP并行化训练循环实现了在4核上1.9倍的加速。该系统使用纯C实现,配有AVX2 SIMD,在一般用的x86-64硬件上约以2,000个token/秒的速度处理。

关键词

引用

@article{arxiv.2605.02904,
  title  = {StateSMix: Online Lossless Compression via Mamba State Space Models and Sparse N-gram Context Mixing},
  author = {Roberto Tacconelli},
  journal= {arXiv preprint arXiv:2605.02904},
  year   = {2026}
}

备注

10 pages