Cogito, Ergo Ludo:一个通过推理与规划学习游戏的智能体
人工智能
2025-09-30 v1 机器学习
摘要
对能够学习掌握复杂环境的人工智能体的追求已取得了显著成功,然而主流的深度强化学习方法通常依赖大量经验,将其知识不透明地编码在神经网络权重中。我们提出了一种不同的范式,即智能体通过推理和规划来学习游戏。我们引入了Cogito, ergo ludo(CEL),一种新颖的智能体架构,它利用大语言模型(LLM)建立对其环境机制和自身策略的显式、基于语言的理解。从没有先验知识(除动作集外)的白板状态开始,CEL在交互和反思的循环中运行。在每个回合后,智能体分析其完整轨迹以执行两个并行的学习过程:规则归纳,其中它细化对环境动力学的显式模型;策略和剧本总结,其中它将经验提炼为可操作的战略剧本。我们在多样的网格世界任务(即扫雷、冰湖和推箱子)上评估CEL,并表明CEL智能体通过自主发现游戏规则和从稀疏奖励中开发有效策略,成功学会了掌握这些游戏。消融研究证实,迭代过程对于持续学习至关重要。我们的工作展示了一条通向更通用和可解释智能体的路径,这些智能体不仅能有效行动,还能通过对原始经验的显式推理,建立一个透明且不断改进的世界模型。
引用
@article{arxiv.2509.25052,
title = {Cogito, Ergo Ludo: An Agent that Learns to Play by Reasoning and Planning},
author = {Sai Wang and Yu Wu and Zhongwen Xu},
journal= {arXiv preprint arXiv:2509.25052},
year = {2025}
}