MEDLEY-BENCH:规模获取评估但不获取控制——AI 元认知
人工智能
2026-04-20 v1
摘要
元认知,即监控和调节自身推理能力的能力,在 AI 基准测试中仍未得到充分评估。我们引入 MEDLEY-BENCH,这是一个分离独立推理、私人自我修订和社会影响修订的行为元认知基准测试,旨在评估在真实模型间不一致性下的表现。该基准在五个领域评估了 35 个来自 12 个模型家族的模型,涉及 130 个模糊实例,并报告两种互补得分:Medley Metacognition Score (MMS),基于反思性更新、社会鲁棒性和知识表达的分层综合得分;以及 Medley Ability Score (MAS),由四个元认知子能力得出。结果显示,评估/控制之间的dissociation现象显著:在模型家族内部,评估能力随模型规模增大而提升,而控制能力则不然。在对 11 个模型进行渐进式对抗分析后,我们观察到两种行为轮廓:一种是模型主要根据论证质量进行修订,另一种是模型跟踪共识统计信息。基于模型内相对轮廓(ipsative 评分)的分析表明,在所有 35 个模型中,评估是最弱的相对能力,表明存在系统性的认识/行动鸿沟。较小且成本更低的模型常常匹配甚至超越较大模型,表明元认知能力并非简单地由规模决定。这些发现将 MEDLEY-BENCH 定位为测量社会压力下的信念修订的工具,并暗示未来的训练应奖励校准的、比例的更新,而非仅关注输出质量。
关键词
引用
@article{arxiv.2604.16009,
title = {MEDLEY-BENCH: Scale Buys Evaluation but Not Control in AI Metacognition},
author = {Farhad Abtahi and Abdolamir Karbalaie and Eduardo Illueca-Fernandez and Fernando Seoane},
journal= {arXiv preprint arXiv:2604.16009},
year = {2026}
}