中文

AGORA:面向LLM代理的推理-free步骤级提示压缩

人工智能 2026-05-27 v1

摘要

广泛用于一般语言模型上下文的token级提取压缩方法在结构上不适用于LLM代理:在17个(环境、主干、方法)单元跨越两个独立token级方法族中,每个单元的平均奖励均<=0.05,尽管实现了1.3-13.3倍的压缩。我们命名并刻画了这一失效模式为动作-语法破坏——携带动作语义的token(标识符、括号、动作动词)恰好自信息秩最低,因此通用压缩器可靠地会删除它们,而环境会拒绝剩余内容。诊断指向步骤级压缩。我们引入AGORA,一种推理-free的步骤级压缩器,结合结构化提示解析器、格式与时效性关键内容的always-keep底层,以及在反事实下一个动作变化标签上训练的125M参数相关性评分器(~2ms/步骤,零步骤LLM负担)。在与推理-free和LLM-based方法比较的结果中,AGORA是唯一一个在8个9个单元中保留>=75%未压缩性能的方案(唯一的例外为73%);四要素消失实验确定结构化底层为主要质量杠杆,而学习评分器为单一固定保持比率实现1.0-11.5x自适应端到端压缩的来源。

关键词

引用

@article{arxiv.2605.26596,
  title  = {AGORA: Adapter-Grounded Observation-Action Retention for Inference-Free Prompt Compression in LLM Agents},
  author = {Haoran Zhang and Zhaohua Sun},
  journal= {arXiv preprint arXiv:2605.26596},
  year   = {2026}
}

备注

10 pages, 2 figures. Code and data: https://github.com/ranranrannervous/agoracompression