中文

少即是多:LLM 在上下文压缩中的规模悖论

机器学习 2026-05-12 v3

摘要

随着模型参数规模的不断增大,提升生成能力一直是训练中的主流范式,基于更大模型可获得更佳生成能力的假设驱动着这一趋势。然而,在压缩--解码器框架中的有损上下文压缩情境下,我们发现出现了一种\textbf{\textit{大小-忠实度悖论}}:压缩器规模增加会削弱重构上下文的忠实度,尽管重构误差却在下降。在27套跨越模型家族、规模和压缩率的压缩器配置中,我们提出了这一悖论,其根源在于两个主导因素:1) \textit{知识覆盖}: 更大的模型会越来越多地用自身的先验信念取代源事实,例如将"the white strawberry"替换为"the red strawberry";2) \textit{语义漂移}: 更大的模型倾向于改写或重构内容,而非逐字重现,例如将"Alice hit Bob"改写为"Bob hit Alice"。有趣的是,这一悖论在各种设置下都持续存在,中等规模的压缩器往往在忠实恢复方面优于大型压缩器。通过分析压缩后的记忆的嵌入几何和重构确定性,我们进一步揭示,压缩器倾向于将记忆组织到更广泛的语义子空间中,从而产生更易受覆盖、漂移和恢复减弱的模糊表示。这些发现补充了现有上下文压缩评估,暴露了当目标从可信生成转向忠实保存时,规模定律的失效。

关键词

引用

@article{arxiv.2602.09789,
  title  = {When Less is More: The LLM Scaling Paradox in Context Compression},
  author = {Ruishan Guo and Yibing Liu and Guoxin Ma and Yan Wang and Yueyang Zhang and Long Xia and Kecheng Chen and Zhiyuan Sun and Daiting Shi},
  journal= {arXiv preprint arXiv:2602.09789},
  year   = {2026}
}

备注

22 pages, 7 figures, conference