我们了解 LLM 所不知道的吗?知识探测中的一致性研究
计算与语言
2025-06-02 v2
摘要
大型语言模型(LLM)的可靠性因其产生幻觉的倾向而大受影响,这突出了精确识别 LLM 内部知识空白的必要性。现有探测此类空白的方法多种多样,包括基于校准的方法和基于提示的方法。为了评估这些探测方法,本文提出了一种基于输入变化和定量指标的新过程。通过这一过程,我们揭示了知识空白探测中不一致性的两个维度。(1)方法内不一致性:提示中的最小非语义扰动会导致同一探测方法内检测到的知识空白出现显著方差;例如,简单地打乱答案选项的变体可能会使一致性降至约 40%。(2)跨方法不一致性:在模型是否知道答案方面,探测方法之间相互矛盾。尽管模型、数据集和提示完全相同,各方法之间却高度不一致——跨方法的决策一致性低至 7%。这些发现对现有的探测方法提出了挑战,并突出了对扰动鲁棒的探测框架的迫切需求。
引用
@article{arxiv.2505.21701,
title = {Do We Know What LLMs Don't Know? A Study of Consistency in Knowledge Probing},
author = {Raoyuan Zhao and Abdullatif Köksal and Ali Modarressi and Michael A. Hedderich and Hinrich Schütze},
journal= {arXiv preprint arXiv:2505.21701},
year = {2025}
}