大语言模型的代理推理
高能物理 - 理论
2026-01-21 v1
摘要
推理是推理、问题解决和决策中所必需的基本认知过程。虽然大语言模型 (LLM) 在封闭世界环境中表现出强大的推理能力,但在开放且动态的环境中仍显得力不从容。代理推理标志着一种范式转变,将 LLM 重新框架化为通过持续交互进行规划、行动和学习的自主代理。本综述沿着三个互补维度组织了代理推理。首先,我们通过三个层次来表征环境动力学:基础代理推理,这一层建立了包括规划、工具使用和搜索在内的核心单一代理能力,适用于稳定环境;自演化代理推理,这一层研究代理如何通过反馈、记忆和适应来细化这些能力;集体多代理推理,这一层将智能扩展到协作环境,涉及协调、知识共享和共同目标。跨越这些层次,我们区分了通过结构化编排实现测试时交互的情境推理,以及通过强化学习和监督微调优化行为的后训练推理。我们进一步综述了跨越科学、机器人、医疗、自主科研和数学等实际应用和基准的代表性代理推理框架。本综述将代理推理方法整合为统一的路线图,连接思考与行动,并概述了开放挑战和未来方向,包括个性化、长期交互、世界建模、可扩展的多代理训练以及实际部署的治理。
引用
@article{arxiv.2601.12537,
title = {Structural Origin of the Gravitino Mass Term: Geometric and Supergravity Perspectives},
author = {Stefano Bellucci and Stefania De Matteo},
journal= {arXiv preprint arXiv:2601.12537},
year = {2026}
}
备注
21 pages, no figures