中文

前沿 LLM 中的领域级元认知监测:33 个模型的图谱

计算与语言 2026-05-11 v1 人工智能 机器学习

摘要

总体元认知质量分数掩盖了模型在 MMLU 基准各领域间的内部差异。我们将 1,500 个 MMLU 条目(每个领域 250 个,按先验的六领域分组)分配给来自八个模型系列的 33 个前沿 LLM,并使用口头化置信度(0-100)计算每个模型-领域单元的 Type-2 AUROC。总观测数为 47,151。每个具有高于随机水平的总体监测能力的模型都表现出非平凡的领域级变异。应用/专业知识可靠地成为最容易监测的基准领域(平均 AUROC = .742,在 33 个模型中有 21 个排名前二);形式推理和自然科学可靠地成为最难监测的领域(在 33 个模型中有 27 个排名后二,二者必居其一)。三个中间领域在统计上无法区分(Kendall's W = .164)。主题级一致性分析(领域内相似比 = 0.95)证实了六领域分组是一种实用的基准分类法,而非经过验证的潜在结构。家族内特征形状聚类对 Anthropic、Google-Gemini 和 Qwen 显著(置换检验 p < .0001),但对 DeepSeek、Google-Gemma 或 OpenAI 不显著。Gemma 4 31B 相比 Gemma 3 27B 显示出 +.202 的 AUROC 提升。在二元 KEEP/WITHDRAW 探针上被归类为无效的三个模型,在口头化置信度下产生了正常的特征,证实了探针格式的特异性。198 个单元上的 Bootstrap 95% 置信区间的中位宽度为 .199。分半总体稳定性 r = .893;特征级分半稳定性较弱(总中位 r = .184)。这些结果表明存在被总体指标掩盖的稳定基准领域变异,并支持将基准阶段领域筛选作为在特定应用领域部署前的一个步骤。

关键词

引用

@article{arxiv.2605.06673,
  title  = {Domain-level metacognitive monitoring in frontier LLMs: A 33-model atlas},
  author = {Jon-Paul Cacioli},
  journal= {arXiv preprint arXiv:2605.06673},
  year   = {2026}
}

备注

25 pages, 7 figures, 1 supplementary table. Code and data: https://github.com/synthiumjp/metacognitive-profile-atlas