基于群体训练的多玩家游戏程序化策略演化框架
机器学习
2025-09-09 v1 人工智能
摘要
多智能体强化学习(MARL)通过自我对弈在解决复杂多玩家游戏方面取得了显著进展。然而,训练有效的对抗性策略需要数百万的经验样本和大量计算资源,而且这些策略缺乏可解释性,阻碍了其实际部署。最近的研究成功地利用大型语言模型(LLM)为单智能体任务生成程序化策略,将基于神经网络的策略转化为可解释的基于规则代码,具有高执行效率。鼓励这一思路,本文提出PolicyEvolve,一个用于多玩家游戏程序化策略生成的通用框架。PolicyEvolve显著减少了对手动构建策略代码的依赖,实现高性能策略,仅通过少量环境交互。该框架包含四个模块:全局池、局部池、策略规划器和�迹评论家。全局池保存在迭代训练期间积累的精英策略。局部池存储当前迭代的临时策略;只有来自该池的足够优秀的策略会被提升到全局池。策略规划器作为核心策略生成模块。它从全局池中抽样前三个策略,基于环境信息生成当前迭代的初始策略,并通过轨迹评论家的反馈不断优化该策略。优化后的策略随后存入局部池。该迭代过程持续到策略在对抗全局池的平均胜率达到足够高水平时,将其整合到全局池中。轨迹评论家分析当前策略的交互数据,识别其漏洞,提出性质化的改进以引导策略规划器。
引用
@article{arxiv.2509.06053,
title = {PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training},
author = {Mingrui Lv and Hangzhi Liu and Zhi Luo and Hongjie Zhang and Jie Ou},
journal= {arXiv preprint arXiv:2509.06053},
year = {2025}
}