中文

LLM 推理中的压缩悖论:提供者依赖的能源效应

计算与语言 2026-03-26 v1

摘要

大型语言模型的快速普及已造成环境悖论:能够帮助解决气候挑战的技术本身正成为全球碳排放的重要贡献者之一。我们测试了提示压缩是否改善了推理能源效率,在 28,421 次成功的 API 试验中(计划 28,428 次),覆盖三个 provider(OpenAI GPT-4o-mini、Anthropic Claude-3.5-Sonnet 和 DeepSeek-Chat)、五个基准(HumanEval、MBPP、GSM8K、MATH、MMLU)和四个压缩比率(r in {1.0, 0.7, 0.5, 0.3})。能源通过基于 token 的 proxy 估计,经校准后与本地直接测量相匹配,quality 通过 benchmark pass rate 跟踪。压缩导致显著的 quality loss(基线通过率为 26.0%,而 r=0.7 时为 1.5%)以及强烈的 provider 依赖能源行为。DeepSeek 在压缩下表现出输出扩张(从 21 个 token 扩展至 r=0.3 时的 798 个 token),对应着最高可达 +2,140% 的能源增长,而 GPT-4o-mini 表现出混合效应,包括在 r=0.5 时的降低。这表明 input-token 减少本身并非生产推理中可靠的能源优化策略。对于所评估的设置,model selection 和 output-length control 提供了比提示压缩更一致的能源-quality trade-off。

关键词

引用

@article{arxiv.2603.23528,
  title  = {The Compression Paradox in LLM Inference: Provider-Dependent Energy Effects of Prompt Compression},
  author = {Warren Johnson},
  journal= {arXiv preprint arXiv:2603.23528},
  year   = {2026}
}

备注

16 pages, 5 figures, 5 tables. Includes data/code availability, ethics statement, and competing interests