中文

快思考与慢思考:面向LLM智能体的步骤级认知深度自适应

人工智能 2026-02-16 v1 计算与语言

摘要

大型语言模型(LLM)正越来越多地被部署为用于多轮决策任务的自主智能体。然而,当前的智能体通常依赖固定的认知模式:非思考模型生成即时响应,而思考模型则统一进行深度推理。这种刚性对于长时域任务来说是低效的,因为在这些任务中,认知需求在不同步骤间差异很大,有些需要战略规划,而另一些只需要常规执行。在本文中,我们引入了CogRouter,一个训练智能体在每一步动态调整认知深度的框架。基于ACT-R理论,我们设计了四个层次化的认知层级,从本能反应到战略规划。我们的两阶段训练方法包括:认知感知监督微调(CoSFT),用于灌输稳定的层级特定模式;以及认知感知策略优化(CoPO),通过置信度感知优势重加权实现步骤级信用分配。关键见解在于,适当的认知深度应最大化由此产生的行动的置信度。在ALFWorld和ScienceWorld上的实验表明,CogRouter以卓越的效率实现了最先进的性能。使用Qwen2.5-7B,它达到了82.3%的成功率,优于GPT-4o(+40.3%)、OpenAI-o3(+18.3%)和GRPO(+14.0%),同时使用的令牌数减少了62%。

关键词

引用

@article{arxiv.2602.12662,
  title  = {Think Fast and Slow: Step-Level Cognitive Depth Adaptation for LLM Agents},
  author = {Ruihan Yang and Fanghua Ye and Xiang We and Ruoqing Zhao and Kang Luo and Xinbo Xu and Bo Zhao and Ruotian Ma and Shanyi Wang and Zhaopeng Tu and Xiaolong Li and Deqing Yang and Linus},
  journal= {arXiv preprint arXiv:2602.12662},
  year   = {2026}
}