中文

基于强化学习的《宝可梦红》

机器学习 2025-03-12 v2

摘要

《宝可梦红》是一款经典的 Game Boy 角色扮演游戏,对智能体而言具有显著的测试挑战,包括多任务处理、数万步的长时间 horizon、困难的探索问题以及大量潜在策略。我们引入了一个简化的环境和深度强化学习(DRL)训练方法,展示了一个基线智能体能够完成游戏初始段,直至完成水晶城。我们的实验包括各种消除实验,揭示了奖励塑形中的漏洞,即智能体会利用特定的奖励信号进行攻击。我们也讨论了局限性,并认为诸如《宝可梦》此类游戏对于未来的大语言模型智能体、层次化训练算法以及高级探索方法具有重要潜力。源码:https://github.com/MarcoMeter/neroRL/tree/poke_red

关键词

引用

@article{arxiv.2502.19920,
  title  = {Pokemon Red via Reinforcement Learning},
  author = {Marco Pleines and Daniel Addis and David Rubinstein and Frank Zimmer and Mike Preuss and Peter Whidden},
  journal= {arXiv preprint arXiv:2502.19920},
  year   = {2025}
}

备注

8 pages, 3 figures, 3 tables, under review