TRIAGE:在资源受限下评估 LLM 前瞻性元认知控制
人工智能
2026-05-14 v1
摘要
将语言模型部署为自主智能体需要超过单任务准确率:当智能体在有限 token 预算下面对问题队列时,必须在执行反馈前决定尝试哪些问题、以何种顺序以及为每个问题分配多少计算资源。这就是人类认知中长期研究的前瞻性元认知控制问题,但语言模型是否具备此能力尚未被测试。我们引入 TRIAGE 框架,模型接收任务池和 calibrated token 预算,提交单个有序计划编码选择、排序和每个问题的分配。计划在了解模型在每个问题上的可解性和成本的 oracle 面前评分,给出 triage 效率比率。我们评估了前沿和开源模型,带与不带推理,分别在数学竞赛、研究生水平科学、代码生成和专家多学科知识任务中,发现当前语言模型在前瞻性元认知控制方面存在显著缺口,揭示了此前未测量的能力维度,对资源高效智能体部署具有直接意义。
引用
@article{arxiv.2605.13414,
title = {TRIAGE: Evaluating Prospective Metacognitive Control in LLMs under Resource Constraints},
author = {Zabir Al Nazi and Shubhashis Roy Dipta},
journal= {arXiv preprint arXiv:2605.13414},
year = {2026}
}