中文

LLM 元认知能力的有限性证据

机器学习 2026-03-26 v2 人工智能

摘要

LLM 自我意识乃至有意识的可能性正引发日益关注的公共注意,具有重大安全与政策影响,但衡量其科学仍处于初级阶段。本文引入一种新颖方法,用于定量评估 LLM 的元认知能力。我们借鉴非人类动物元认知研究的思路,摒弃模型自我报告,转而测试模型在策略性部署内部状态知识方面的能力。通过两种实验范式,我们展示自 2024 年初出现的前沿 LLM 显示出越来越强的某些元认知能力证据,具体包括:准确判断自身解答事实性与推理问题正确性的信心,以及能预见自己会给出何种答案并妥善利用此信息的能力。我们通过分析模型返回的 token 概率,进一步表明存在一种 upstream 内部信号可为元认知提供基础。我们进一步发现,这些能力 1) 分辨率有限,2) 以情境依赖的方式显现,3) 似乎与人类不同。我们也报告了类似能力模型之间存在的有趣差异,暗示 LLM 后训练可能在发展元认知能力方面发挥作用。

关键词

引用

@article{arxiv.2509.21545,
  title  = {Evidence for Limited Metacognition in LLMs},
  author = {Christopher Ackerman},
  journal= {arXiv preprint arXiv:2509.21545},
  year   = {2026}
}

备注

26 pages, 25 figures