PokeRL:针对 Pokemon Red 的强化学习
机器学习
2026-04-14 v1
摘要
Pokemon Red 是一款具有长期时间窗、稀疏奖励、部分可观测性以及古怪控制机制的JRPG,这使其成为强化学习的具挑战性的基准。虽然最近的工作表明 PPO 智能体在重型奖励塑形和工程化观测下可完成前两个教练的任务,但训练在实践中仍然脆弱,智能体常常退化为动作循环、菜单垃圾或无产的 wander。本文提出了 PokeRL,一个模块化系统,用于训练在 Pokemon Red 中完成早期游戏任务的深度强化学习智能体,包括从玩家房子出发、探索 Pallet Town 以到达草地,以及赢得第一个对手战斗。我们的主要贡献包括:围绕 PyBoy 模拟器的循环感知环境包装器(带地图遮蔽)、多层反循环和反垃圾机制,以及密集的层次化奖励设计。我们认为,像 PokeRL 这样的实用系统——它们显式地建模诸如循环和垃圾等失败模式——是从玩具基准迈向完整的 Pokemon 联盟冠军智能体之间的必要中间步骤。代码已在 https://github.com/reddheeraj/PokemonRL 上提供。
引用
@article{arxiv.2604.10812,
title = {PokeRL: Reinforcement Learning for Pokemon Red},
author = {Dheeraj Mudireddy and Sai Patibandla},
journal= {arXiv preprint arXiv:2604.10812},
year = {2026}
}