变革者:自演化 LLM 代理用于战略规划
人工智能
2025-10-14 v2
摘要
我们解决了大语言模型 (LLM) 代理在长期规划任务中的跨越问题,通过使其在对抗性、随机环境中维持连贯的战略。Settlers of Catan 提供了一个具有挑战性的基准:成功取决于在随机性、交易、扩张和阻挡之间平衡短期和长期目标。以提示为中心的 LLM 代理(如 ReAct、Reflexion)必须每回合重新解释大型、不断演变的游戏状态,迅速耗尽上下文窗口并丧失战略一致性。我们提出 HexMachina,一个持续学习多代理系统,将环境发现(在无文档情况下诱导适配器层)与策略改进(通过代码精炼和仿真演化编译玩家)分离。该设计保留可执行制品,使 LLM 能够专注于高层次战略而非每回合推理。在受控的 Catanatron 实验中,HexMachina 从零学习并演化出超越最强人工制作基线(AlphaBeta)的玩家,实现 54% 的胜率,显著优于提示驱动和无发现基线。消融实验确认,隔离纯策略学习可提升性能。总体而言,面向制品的持续学习将 LLM 从脆弱的逐步决策者转变为稳定的战略设计者,推动了长期自主性的实现。
引用
@article{arxiv.2506.04651,
title = {Agents of Change: Self-Evolving LLM Agents for Strategic Planning},
author = {Nikolas Belle and Dakota Barnes and Alfonso Amayuelas and Ivan Bercovich and Xin Eric Wang and William Wang},
journal= {arXiv preprint arXiv:2506.04651},
year = {2025}
}