大型语言模型还能自我解释吗?探讨量化对自我解释影响
计算与语言
2026-01-05 v1 人工智能
机器学习
摘要
量化技术广泛用于加速推理和简化大型语言模型(LLM)的部署,但其对自我解释(SEs)的影响尚未探讨。SEs是LLM生成的,用于为其输出提供依据的解释,要求模型对自身决策过程进行推理,这一能力可能对量化较为敏感。随着SEs在高风险应用中被越来越多地依赖,了解量化是否及其程度地降低了SEs的质量和忠实性,变得至关重要。为此,我们考察了两种类型的SEs:由自然语言解释(NLEs)和反事实示例构成,这些由使用三种常见量化技术在不同比特宽度下量化的LLM生成。我们的发现表明,量化通常会导致两方面都出现中度下降:SEs的质量(最高降低4.4%)和忠实性(最高降低2.38%)。用户研究进一步显示,量化会降低SEs的连贯性和可信度(最高降低8.5%)。与小型模型相比,大型模型在SEs质量方面对量化的抗性较差,但在保持忠实性方面表现更好。此外,没有任何量化技术在任务准确率、SEs质量和忠实性方面 consistently 表现优异。鉴于量化的影响因具体情境而异,我们建议针对特定用例验证SEs的质量,尤其是NLEs,因为其对量化更敏感。尽管如此,SEs质量和忠实性的相对轻微退化并不削弱量化作为模型压缩技术的有效性。
引用
@article{arxiv.2601.00282,
title = {Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations},
author = {Qianli Wang and Nils Feldhus and Pepa Atanasova and Fedor Splitt and Simon Ostermann and Sebastian Möller and Vera Schmitt},
journal= {arXiv preprint arXiv:2601.00282},
year = {2026}
}
备注
In submission