中文

野生中的提示压缩:测量更快的 LLM 推理中的延迟、速率遵循与质量

信息检索 2026-04-06 v1 人工智能 计算与语言

摘要

随着语言模型在信息检索中广泛采用,尤其是 RAG 系统,底层 LLM 的延迟成为关键瓶颈,因为检索段落的长上下文导致大型提示,从而增加计算量。提示压缩技术通过保留下游任务性能来减少输入提示的大小,已被证明是加速大型语言模型推理的成本效益高且低延迟的方法。然而,其有用性取决于额外的预处理时间在生成期间是否被更快的解码所抵消。我们进行了首次大规模系统性研究,涉及数千次运行和 30,000 个查询,测试多个开源 LLM 和三个 GPU 类别。我们的评估将压缩开销与解码延迟分离,同时跟踪输出质量和内存使用情况。当提示长度、压缩比和硬件容量匹配良好时,LLMLingua 可实现最高 18% 的端到端加速,同时在摘要、代码生成和问答任务中保持响应质量的统计学不变。但在 operating window 之外,压缩步骤占主导,抵消了所有收益。我们还展示了有效压缩足以将数据中心 GPU 的工作负载卸载到商品级卡上,仅增加 0.3 秒的延迟。我们的开源分析器为每个模型-硬件组合预测延迟盈亏平衡点,提供关于何时进行提示压缩可在实际场景中提供实际收益的实用指导。

关键词

引用

@article{arxiv.2604.02985,
  title  = {Prompt Compression in the Wild: Measuring Latency, Rate Adherence, and Quality for Faster LLM Inference},
  author = {Cornelius Kummer and Lena Jurkschat and Michael Färber and Sahar Vahdati},
  journal= {arXiv preprint arXiv:2604.02985},
  year   = {2026}
}

备注

Accepted at ECIR 2026 (Full Paper)