LLMs 在自我认知方面有感知,但并未行动:面向测试时扩展的元认知托架
机器学习
2026-05-15 v1
摘要
大型语言模型(LLMs)常常暴露出有用的自我监控信号:在解决问题前,它们可以估计自己是否大概率成功,在解决问题后,它们可以判断自己的答案是否大概率正确。然而,这些信号通常以孤立的方式进行测量或提取,而非用于控制推理。在本工作中,我们询问 LLMs 是否具备可转化为有效测试时控制能力的潜在元认知能力。灵感来自认知心理学中的 Nelson--Narens 理论,我们提出一种元认知托架,将监控与推理分离。对于每个问题,模型首先报告解决前的感觉-知道(FOK)信号;在每次解答后,它报告学习判断(JOL)信号。Rather than 将这些信号视为被动置信度估计,托架将其转化为推理的显式控制接口:它决定在何时信赖当前解答,在何时以紧凑的元认知反馈重试,在何时将多个尝试传递给最终聚合器。在文本、代码和多模态推理基准测试中,我们的托架在不进行参数更新或基准特定微调的情况下,显著提高了固定的 Claude Sonnet-4.6 基线模型。对于评估的公开基准快照, pooled accuracy 从 48.3 提升至 56.9,并在三个主要评估设置:HLE-Verified、LiveCodeBench v6 和 R-Bench-V 上超越了列出的最强条目。这些结果表明,强大的 LLMs 可能已经具备有用的元认知能力,但需要显式的控制托架才能在推理期间发挥作用。
引用
@article{arxiv.2605.14186,
title = {LLMs Know When They Know, but Do Not Act on It: A Metacognitive Harness for Test-time Scaling},
author = {Qi Cao and Yufan Wang and Peijia Qin and Shuhao Zhang and Pengtao Xie},
journal= {arXiv preprint arXiv:2605.14186},
year = {2026}
}