LLM 显微镜:揭示模型内部关于答案正确性和上下文利用的信号
计算与语言
2025-10-07 v1
摘要
尽管大型语言模型(LLMs)具有巨大的实用价值,但其可信度仍是一个主要关切:模型常常以高置信度生成错误信息。虽然上下文信息可以帮助引导生成,但识别查询是否受益于检索到的上下文,以及评估该上下文的有效性,仍然具有挑战性。在本工作中,我们将可解释性方法具体化,以确定是否仅凭模型的激活值即可预测模型输出的正确性。我们还探讨了模型内部是否包含关于外部上下文有效性的信号。我们考虑正确、错误和无关上下文,并引入指标来区分其中差异。对六个不同模型的实验表明,仅凭第一个输出 token 的中间层激活值训练的简单分类器,即可以约75%的准确率预测输出正确性,实现早期审计。我们提出的基于模型内部的指标在区分正确与错误上下文方面显著优于提示基准,能够捕捉由污染上下文引入的误差。这一发现为更好地理解 LLM 的底层决策过程提供了新的视角。我们的代码已公开于 https://github.com/jiarui-liu/LLM-Microscope。
引用
@article{arxiv.2510.04013,
title = {LLM Microscope: What Model Internals Reveal About Answer Correctness and Context Utilization},
author = {Jiarui Liu and Jivitesh Jain and Mona Diab and Nishant Subramani},
journal= {arXiv preprint arXiv:2510.04013},
year = {2025}
}