压缩镜头下的事实知识记忆
计算与语言
2026-04-30 v3 机器学习
摘要
量化方法广泛用于加速推理和简化大型语言模型(LLM)的部署。尽管对LLM各种能力的量化影响已有广泛研究,但一个关键领域仍未得到充分探索:事实知识记忆(FKR),即LLM访问存储知识的过程。为此,我们针对三种常见的量化技术在不同比特宽度上,结合基于可解释性的分析,对两个任务(知识记忆和潜在多跳推理)进行了全面实验。我们表明,量化通常会导致LLM中的信息损失,从而削弱其进行FKR的能力。这一效应在同一建筑族系中较小的模型中尤为放大。然而,采用较低比特精度量化的模型并不一定表现出劣势,量化有时甚至可能提升模型的FKR。我们发现BitSandBytes在保持原始全精度模型FKR方面效果最佳。尽管不同模型和方法存在差异,量化仍然是一种有效的压缩策略,仅导致性能的适度退化。
引用
@article{arxiv.2505.13963,
title = {Through a Compressed Lens: Investigating The Impact of Quantization on Factual Knowledge Recall},
author = {Qianli Wang and Mingyang Wang and Nils Feldhus and Simon Ostermann and Yuan Cao and Hinrich Schütze and Sebastian Möller and Vera Schmitt},
journal= {arXiv preprint arXiv:2505.13963},
year = {2026}
}
备注
TrustNLP @ ACL 2026; camera-ready version