测量AI的元认知能力
人工智能
2026-04-17 v2
摘要
稳健的决策过程必须考虑不确定性,尤其是当选择涉及内在风险时。由于人工智能(AI)系统日益集成到决策工作流程中,管理不确定性更依赖于这些系统的元认知能力;即,这些系统评估自身决策可靠性并调节自身决策的能力。因此,不得不采用稳健的方法来衡量AI的元认知能力。本文主要是一项方法论贡献,主张将meta-d框架作为评估AI元认知灵敏度的金标准——即其生成的置信度评级能够区分正确与错误响应的能力。此外,我们提出利用信号检测理论(SDT)来衡量AI基于不确定性和风险自主调节决策的能力。为演示这些心理物理框架的实际用途,我们在三个大型语言模型(LLM)——GPT-5、DeepSeek-V3.2-Exp和Mistral-Medium-2508——上进行了两系列实验。在第一系列实验中,LLM执行一次主要判断,然后给出置信度评级。在第二系列实验中,LLM仅执行主要判断,而我们人为操控了该响应所涉及的风险。一方面,应用meta-d框架允许我们沿三个维度进行比较:将LLM与最优性进行比较、对比不同LLM在给定任务上的表现、以及比较同一LLM在不同任务中的表现。另一方面,SDT允许我们评估LLM在风险较高时是否变得更保守。
引用
@article{arxiv.2603.29693,
title = {Measuring the metacognition of AI},
author = {Richard Servajean and Philippe Servajean},
journal= {arXiv preprint arXiv:2603.29693},
year = {2026}
}
备注
19 pages, 5 figures, 2 tables