中文

元认知探针:面向 LLM 的五种行为校准诊断

人工智能 2026-05-12 v1 计算与语言 机器学习

摘要

元认知探针 (The Metacognitive Probe) 是一种探索性的五任务、15槽位诊断工具,将 LLM 的置信度行为分解为五个行为上独立的维度:置信度校准 (T1-CC)、认知警惕 (T2-EV)、知识边界 (T3-KB)、校准范围 (T4-CR) 和推理链验证 (T5-RCV)。该工具在 N=8 个前沿模型和 N=69 个人类上进行了评估。该工具的动机源于 Flavell (1979) 和 Nelson 与 Narens (1990) 的工作,但基于可观测的置信度-正确性对齐运作;它并非经过验证的跨物种元认知量表,且预先设定的人类发展假设被证伪。综合基准 (MMLU, BIG-Bench, HELM, GPQA) 询问模型是否产生正确响应。它们对于模型是否知道其响应何时错误保持沉默。一个模型在综合校准基准上可以得分 80,但在聚合无法显现的狭窄局部中仍然极其过度自信。元认知探针揭示了这些局部。我们的核心结果是 Gemini 2.5 Flash 中 47 个点的模型内分离:任务内最佳校准 (T1-CC = 88; Spearman rho = +0.551, 95% CI [+0.14, +0.80], p = 0.005) 和任务间最差难度预测 (T4-CR = 41; sigma_conf = 1.4 across twelve factoids)。

关键词

引用

@article{arxiv.2605.09844,
  title  = {The Metacognitive Probe: Five Behavioural Calibration Diagnostics for LLMs},
  author = {Rafael C. T. Oliveira},
  journal= {arXiv preprint arXiv:2605.09844},
  year   = {2026}
}

备注

27 pages, 13 tables. Code, data, prompts, and rubrics released with the paper. OSF deposit pending; DOI in v2