中文

通过对手利用策略增强的大语言模型规划

人工智能 2025-06-03 v2

摘要

高效建模和利用对手是对抗领域长期以来的挑战。大规模语言模型(LLM)最近在广泛任务上展现出卓越性能,为对手建模的研究开辟了新的方向。一些研究主要关注直接使用LLM基于包含对手描述的详尽提示上下文生成决策,而这些方法仅限于LLM具备足够领域专业知识的场景。为此,我们引入了一个两阶段策略增强规划(SAP)框架,通过利用关键组件——策略评估网络(SEN)—显著提升LLM代理的对手利用能力。在离线阶段,我们构建了显式的策略空间,并收集策略-结果对数据用于训练SEN网络。在在线阶段,SAP通过在精心设计的提示下搜索在经过训练的SEN上找到最佳应对策略,从而动态识别对手的策略并贪心地利用它们,将策略转化为一系列动作。实验结果表明,SAP具有鲁棒的泛化能力,能够不仅有效应对之前遇到的对手策略,还能有效应对新颖、未曾遇到的策略。在MicroRTS环境中,SAP相对于基线方法实现了85.35%85.35\%的性能提升,并在对抗最先进(SOTA)规则基AI时表现出竞争力。我们的代码已公开于https://github.com/hsushuai/SAP。

关键词

引用

@article{arxiv.2505.08459,
  title  = {Strategy-Augmented Planning for Large Language Models via Opponent Exploitation},
  author = {Shuai Xu and Sijia Cui and Yanna Wang and Bo Xu and Qi Wang},
  journal= {arXiv preprint arXiv:2505.08459},
  year   = {2025}
}

备注

Accepted to IJCNN 2025