赋予 LLM 参数化技能以对抗性长期规划
计算与语言
2025-09-17 v1
摘要
最近的大型语言模型(LLM)发展导致基于 LLM 的 AI 代理开发取得进展。一个关键挑战是创建能够有效地在复杂、对抗性长期环境中自我定位的代理。现有方法主要关注(1)将 LLM 用作策略,通过生成低级可行动作与环境交互,以及(2)利用 LLM 生成高层次任务或语言指南来激发动作生成。然而,前者难以生成可靠的动作,后者则高度依赖专家经验将高层次任务转化为具体动作序列。为此,我们提出了 Plan with Language, Act with Parameter(PLAP)规划框架,以促进 LLM 基于代理在长期环境中的自我定位。PLAP 方法包括三个关键组件:(1)包含环境特定参数化技能的技能库,(2)由 LLM 驱动的技能规划器,以及(3)将参数化技能转换为可执行动作序列的技能执行器。我们在 MicroRTS 中实现了 PLAP,这是一个为 LLM 提供陌生且具有挑战性环境的长期实时策略游戏。实验结果表明 PLAP 的有效性。特别是,GPT-4o 驱动的 PLAP 在零样本设置下超过了 80% 的基线代理,Qwen2-72B 驱动的 PLAP 在精心构建的 few-shot 示例下超过了最高级脚本化代理 CoacAI。此外,我们设计了全面的评估指标并测试了 6 个封闭源和 2 个开源 LLM 在 PLAP 框架中的表现,最终发布了 LLM 排行榜,对长期技能规划能力进行排序。我们的代码可在 https://github.com/AI-Research-TeamX/PLAP 提供。
引用
@article{arxiv.2509.13127,
title = {Empowering LLMs with Parameterized Skills for Adversarial Long-Horizon Planning},
author = {Sijia Cui and Shuai Xu and Aiyao He and Yanna Wang and Bo Xu},
journal= {arXiv preprint arXiv:2509.13127},
year = {2025}
}
备注
Accepted to IJCNN 2025