通过可扩展的离线强化学习实现的人类水平对抗宝可梦
机器学习
2025-07-31 v2
摘要
对抗性宝可梦单挑赛(Competitive Pokémon Singles, CPS)是一款流行的策略游戏,玩家需在持续超过百回合的随机战斗中基于不完全信息对对手进行策略利用。目前CPS的人工智能研究主要依赖启发式树搜索和在线自我对弈,但该游戏也为在大规模数据集上进行离线训练的自适应策略研究提供了平台。我们构建了一条管线,从观众第三人称视角保存的日志中重建代理的第一人称视角,从而解锁了跨越十余年、每日都在增长的真实人类对战数据集。该数据集使我们能够采用黑箱方法,对大规模序列模型进行训练,仅凭对手的输入轨迹即可适应对手并在无任何显式搜索的情况下选择动作。我们研究了从模仿学习到离线强化学习,再到在宝可梦四代最古老(且信息最不完全)的游戏版本中进行的离线微调的 progression。最终得到的代理对最新的LLM代理方法和强型启发式搜索引擎均表现出优势。在匿名在线对战中,我们的最佳代理可爬升至活跃玩家前10%的排名。所有代理检查点、训练细节、数据集和基线均可在 https://metamon.tech 获取。
引用
@article{arxiv.2504.04395,
title = {Human-Level Competitive Pok\'emon via Scalable Offline Reinforcement Learning with Transformers},
author = {Jake Grigsby and Yuqi Xie and Justin Sasek and Steven Zheng and Yuke Zhu},
journal= {arXiv preprint arXiv:2504.04395},
year = {2025}
}
备注
Reinforcement Learning Conference 2025