中文

压缩后的 LLM 真能行动吗?对 LLM 压缩中智能体能力的实证评估

机器学习 2025-06-03 v2

摘要

训练后压缩降低了大语言模型(LLM)的计算和内存成本,实现了资源高效的部署。然而,现有的压缩基准仅关注语言建模(如困惑度)和自然语言理解任务(如 GLUE 准确率),忽略了智能体能力——工作流、工具使用/函数调用、长上下文理解和实际应用。我们引入了 Agent Compression Benchmark (ACBench),这是第一个用于评估压缩如何影响 LLM 智能体能力的综合基准。ACBench 涵盖:(1)4 项能力下的 12 个任务(例如用于工作流生成的 WorfBench,用于长上下文检索的 Needle-in-Haystack),(2)量化(GPTQ、AWQ)和剪枝(Wanda、SparseGPT),以及(3)15 个模型,包括小型(Gemma-2B)、标准(Qwen2.5 7B-32B)和蒸馏推理 LLM(DeepSeek-R1-Distill)。我们的实验揭示了压缩的权衡:4 比特量化保留了工作流生成和工具使用能力(下降 1%-3%),但使实际应用准确率下降了 10%-15%。我们引入了 ERank、Top-k 排序相关性和能量来系统化分析。ACBench 为在智能体场景下优化 LLM 压缩提供了可操作的见解。代码可在 https://github.com/pprp/ACBench 找到。

关键词

引用

@article{arxiv.2505.19433,
  title  = {Can Compressed LLMs Truly Act? An Empirical Evaluation of Agentic Capabilities in LLM Compression},
  author = {Peijie Dong and Zhenheng Tang and Xiang Liu and Lujun Li and Xiaowen Chu and Bo Li},
  journal= {arXiv preprint arXiv:2505.19433},
  year   = {2025}
}

备注

Accepted by ICML2025 as Poster