中文

知何时信任技能:面向单智能体大语言模型的延迟评估与认知警觉

人工智能 2026-04-21 v1

摘要

随着大语言模型(LLM)转变为与广泛工具生态系统集成的自主智能体,传统的路由启发式方法日益受到上下文污染和“过度思考”的影响。我们认为,瓶颈并非算法能力或技能多样性的不足,而是缺乏有纪律的二阶元认知治理。本文的科学贡献在于将人类认知控制的计算翻译——具体而言,延迟评估、认知警觉和近端区域卸载——引入单智能体架构。我们提出了MESA-S(面向智能体的元认知技能,单智能体),这是一个初步框架,它将标量置信度估计转变为分离自我置信度(参数确定性)与源置信度(对检索到的外部程序的信任)的向量。通过形式化延迟程序探测机制并引入元认知技能卡,MESA-S将技能效用的意识与其令牌密集的执行解耦。在通过Gemini 3.1 Pro原生执行的上下文静态基准评估下,我们的初步结果表明,显式编程信任来源和延迟升级可缓解供应链漏洞、修剪不必要的推理循环,并防止卸载引起的置信度膨胀。该架构为可靠、认知警觉的单智能体编排提供了科学上谨慎、行为上锚定的一步。

关键词

引用

@article{arxiv.2604.16753,
  title  = {Know When to Trust the Skill: Delayed Appraisal and Epistemic Vigilance for Single-Agent LLMs},
  author = {Eren Unlu},
  journal= {arXiv preprint arXiv:2604.16753},
  year   = {2026}
}

备注

7 pages, 1 figure