中文

MIRROR:用于大型语言模型元认知校准的分层基准测试

人工智能 2026-04-23 v1 机器学习

摘要

我们引入了 MIRROR,这是一个包含跨四个元认知级别的八个实验的基准测试,用于评估大型语言模型能否利用自我知识做出更好的决策。我们使用五个独立的行为测量通道,对来自 8 个实验室的 16 个模型在大约 250,000 个评估实例上进行了评估。核心实验在完整的模型阵容中进行;具有专门基础设施需求的实验报告了明确标记的模型子集。我们发现了两个对智能体部署有直接影响的现象:(1)组合式自我预测普遍失败——在最初的 15 个模型 Exp3-v1 集合上,组合校准误差范围从 0.500 到 0.943(在平衡的 16 个模型 Exp3-v2 扩展集上为 0.434 到 0.758),表明模型无法预测自身在多领域任务上的表现;(2)模型表现出高于随机水平但不完美的领域特定自我知识,却系统性地无法将这种部分认知转化为适当的智能体动作选择——外部元认知控制将置信失败率从 0.600 降至 0.143(在温度为 0 时降低了 76%;在温度为 0.7 时,来自 4 个实验室的 5 个模型平均降低了 70%)。为模型提供其自身的校准分数并未产生显著改善(p > 0.05);只有架构约束是有效的。这表明,外部元认知支架——而非改善的自我知识——是通往更安全的自主 AI 系统的路径。代码、数据和 Croissant 元数据将随基准测试一起公开发布。

关键词

引用

@article{arxiv.2604.19809,
  title  = {MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models},
  author = {Jason Z Wang},
  journal= {arXiv preprint arXiv:2604.19809},
  year   = {2026}
}

备注

30 pages, 6 figures,code at: https://github.com/Jason-Wang313/Mirror