中文

TRIAGE:在资源受限下评估 LLM 前瞻性元认知控制

人工智能 2026-05-14 v1

摘要

将语言模型部署为自主智能体需要超过单任务准确率:当智能体在有限 token 预算下面对问题队列时,必须在执行反馈前决定尝试哪些问题、以何种顺序以及为每个问题分配多少计算资源。这就是人类认知中长期研究的前瞻性元认知控制问题,但语言模型是否具备此能力尚未被测试。我们引入 TRIAGE 框架,模型接收任务池和 calibrated token 预算,提交单个有序计划编码选择、排序和每个问题的分配。计划在了解模型在每个问题上的可解性和成本的 oracle 面前评分,给出 triage 效率比率。我们评估了前沿和开源模型,带与不带推理,分别在数学竞赛、研究生水平科学、代码生成和专家多学科知识任务中,发现当前语言模型在前瞻性元认知控制方面存在显著缺口,揭示了此前未测量的能力维度,对资源高效智能体部署具有直接意义。

关键词

引用

@article{arxiv.2605.13414,
  title  = {TRIAGE: Evaluating Prospective Metacognitive Control in LLMs under Resource Constraints},
  author = {Zabir Al Nazi and Shubhashis Roy Dipta},
  journal= {arXiv preprint arXiv:2605.13414},
  year   = {2026}
}