中文

困惑悖论:为何在 LLM 提示中代码压缩得更好?

计算与语言 2026-02-19 v1 人工智能

摘要

在《Compress or Route?》(Johnson,2026)中,我们发现代码生成容忍更激进的提示压缩(r >= 0.6),而链式思考推理逐渐降解。该研究仅限于 HumanEval(164 个问题),未验证“困惑悖论”机制,也未提供自适应算法。本文填补了这三个差距。首先,我们在六个代码基准(HumanEval、MBPP、HumanEval+、MultiPL-E)和四个推理基准(GSM8K、MATH、ARC-Challenge、MMLU-STEM)上进行验证,确认压缩阈值在不同语言和难度级别下均成立。其次,我们进行首次的每 token 概率分析(n=723 个 token),揭示“困惑悖论”:代码语法 token 被保留(高困惑度),而数学问题中的数值 token 被削减尽管属于任务关键(低困惑度)。签名注入可使通过率提升 34 个百分点(从 5.3% 提升至 39.3%;Cohen's h=0.890)。最后,我们提出 TAAC(任务感知自适应压缩),实现 22% 的成本降低,同时保持 96% 的质量,凌超固定比例压缩的 7%。MBPP 验证(n=1,800 次试验)确认系统性变化:在 r=0.3 时为 3.6%,在 r=1.0 时为 54.6%。

关键词

引用

@article{arxiv.2602.15843,
  title  = {The Perplexity Paradox: Why Code Compresses Better Than Math in LLM Prompts},
  author = {Warren Johnson},
  journal= {arXiv preprint arXiv:2602.15843},
  year   = {2026}
}

备注

19 pages, 5 figures, 4 tables. Second paper in TAAC research series. Code and data at https://github.com/micoverde/taac-llm-compression