基于强化学习的《宝可梦红》
机器学习
2025-03-12 v2
摘要
《宝可梦红》是一款经典的 Game Boy 角色扮演游戏,对智能体而言具有显著的测试挑战,包括多任务处理、数万步的长时间 horizon、困难的探索问题以及大量潜在策略。我们引入了一个简化的环境和深度强化学习(DRL)训练方法,展示了一个基线智能体能够完成游戏初始段,直至完成水晶城。我们的实验包括各种消除实验,揭示了奖励塑形中的漏洞,即智能体会利用特定的奖励信号进行攻击。我们也讨论了局限性,并认为诸如《宝可梦》此类游戏对于未来的大语言模型智能体、层次化训练算法以及高级探索方法具有重要潜力。源码:https://github.com/MarcoMeter/neroRL/tree/poke_red
引用
@article{arxiv.2502.19920,
title = {Pokemon Red via Reinforcement Learning},
author = {Marco Pleines and Daniel Addis and David Rubinstein and Frank Zimmer and Mike Preuss and Peter Whidden},
journal= {arXiv preprint arXiv:2502.19920},
year = {2025}
}
备注
8 pages, 3 figures, 3 tables, under review