LLM是否具备自省能力?一个现实检验
人工智能
2026-05-27 v1
摘要
大型语言模型能否检测并报告其自身内部状态?已有研究认为答案是否定。我们认为,基于人类元认知研究的经验,这一结论可能过于确定:要相信该结论,我们需要区分真正的自省与基于表面线索的模式匹配。此外,我们认为仅凭行为证据本身就不足以确立强烈的自省主张。我们重新审视两种近期引入的评估范式,以便进行此种考虑。在第一范式中,模型被期望检测其内部状态是否被篡改。我们发现模型无法可靠地区分这种对内部状态的干预与输入操纵的作用,这表明其在原始研究中的成功更多是反映了其检测异常的能力,而不仅仅是针对特定内部状态干预的能力。在第二范式中,我们检查模型被要求预测源自其自身隐藏状态的标签。这里,我们发现仅访问输入的分类器实现的性能相当于模型自己的in-context预测,表明原始结果并不具备决定性地证明模型对其内部表示拥有特权访问权。我们进一步引入了一个重新标注的控制设置,模型无法依赖任务语义来解决问题,而必须依赖内部表示;在这个更受控制的任务版本中,模型的表现接近随机水平。综合这些结果表明,当前证据不足以确立LLM显示元认知监控的事实。
引用
@article{arxiv.2605.26242,
title = {Can LLMs Introspect? A Reality Check},
author = {Shashwat Singh and Tal Linzen and Shauli Ravfogel},
journal= {arXiv preprint arXiv:2605.26242},
year = {2026}
}