量化是否影响模型在长上下文任务上的性能?
计算与语言
2025-09-23 v3 人工智能
摘要
大语言模型(LLMs)现在支持超过 128K token 的上下文窗口,但这带来了显著的内存需求和较高的推理延迟。量化可以缓解这些开销,但可能会降低性能。在本工作中,我们首次对量化 LLM 在具有长输入(>64K token)和长格式输出的任务上的表现进行了系统评估。我们的评估涵盖了 9.7K 个测试样本、五种量化方法(FP8、GPTQ-int8、AWQ-int4、GPTQ-int4、BNB-nf4)以及五个模型(Llama-3.1 8B 和 70B;Qwen-2.5 7B、32B 和 72B)。我们发现,平均而言 8 位量化保持了准确率(下降约 0.8%),而 4 位方法导致了显著的性能损失,特别是对于涉及长上下文输入的任务(下降高达 59%)。当输入语言非英语时,这种退化往往更为严重。至关重要的是,量化的影响在很大程度上取决于量化方法、模型和任务。例如,虽然 Qwen-2.5 72B 在 BNB-nf4 下保持稳健,但 Llama-3.1 70B 在同一任务上经历了 32% 的性能下降。这些发现强调了在部署量化 LLM 之前进行仔细的、特定任务评估的重要性,特别是在长上下文场景和非英语语言中。
引用
@article{arxiv.2505.20276,
title = {Does quantization affect models' performance on long-context tasks?},
author = {Anmol Mekala and Anirudh Atmakuru and Yixiao Song and Marzena Karpinska and Mohit Iyyer},
journal= {arXiv preprint arXiv:2505.20276},
year = {2025}
}
备注
to appear in EMNLP 2025