中文

大语言模型是否了解自身所知?基于信号检测理论的元认知效率测量

计算与语言 2026-03-27 v1 人工智能

摘要

标准的大语言模型置信度评估依赖校准指标(如 ECE、Brier 分数),这些指标混合了两个 distinct 能力:模型了解多少知识(Type-1 灵敏度)以及模型了解自身所知的程度(Type-2 元认知灵敏度)。我们引入基于 Type-2 信号检测理论的评估框架,通过 meta-d' 和元认知效率比 M-ratio 分解这两个能力。应用于四个大语言模型(Llama-3-8B-Instruct、Mistral-7B-Instruct-v0.3、Llama-3-8B-Base、Gemma-2-9B-Instruct)进行 224,000 份事实性问答试验,我们发现:(1)即使在 Type-1 灵敏度相似的情况下,元认知效率在不同模型之间存在显著差异——Mistral 实现最高的 d' 但最低的 M-ratio;(2)元认知效率具有域特定性,不同模型显示不同的弱点领域,这在聚合指标中难以察觉;(3)温度操作会改变 Type-2 判别标准,而对两个模型而言 meta-d' 保持稳定,这将置信度策略与元认知能力从属化;(4)AUROC_2 和 M-ratio 产生完全相反的模型排名,表明这些指标回答的是根本不同的评估问题。meta-d' 框架揭示了哪些模型“了解自身所不知道的东西”,而哪些仅仅是由于判别标准安放位置而显得较为校准——这一区别直接影响模型选择、部署以及人类-人工智能协作。预先登记的分析;代码和数据公开可用。

关键词

引用

@article{arxiv.2603.25112,
  title  = {Do LLMs Know What They Know? Measuring Metacognitive Efficiency with Signal Detection Theory},
  author = {Jon-Paul Cacioli},
  journal= {arXiv preprint arXiv:2603.25112},
  year   = {2026}
}

备注

12 pages, 3 figures, 7 tables. Pre-registered; code and data at https://anonymous.4open.science/r/sdt_calibration