中文

PCGRL+: 强化学习关卡生成中的规模、控制与泛化

机器学习 2024-08-23 v1 人工智能

摘要

基于强化学习的程序化内容生成(Procedural Content Generation via Reinforcement Learning, PCGRL)已被引入作为一种仅通过一组可计算度量(充当关卡质量和关键特性的代理)来训练可控设计代理的手段。虽然 PCGRL 为游戏设计师提供了独特的功能,但其受限于计算密集的训练过程,且迄今为止仅能生成相对较小的关卡。为解决此规模问题,我们在 Jax 中实现了多个 PCGRL 环境,使学习和仿真的所有方面都在 GPU 上并行处理,从而实现更快的环境仿真;消除 RL 训练期间 CPU-GPU 信息传输的瓶颈;最终显著提升了训练速度。我们在新框架下复制了先前工作的多个关键结果,让模型训练的时间更长,评估其在 10 亿个时间步后行为。为实现对人类设计师的更大控制,我们引入了随机关卡大小和冻结的“关键点”作为进一步抑制过拟合的方式。为测试所学生成器的泛化能力,我们在大规模、分布外的地图大小上评估模型,发现部分观察大小的模型学习出更稳健的设计策略。

关键词

引用

@article{arxiv.2408.12525,
  title  = {PCGRL+: Scaling, Control and Generalization in Reinforcement Learning Level Generators},
  author = {Sam Earle and Zehua Jiang and Julian Togelius},
  journal= {arXiv preprint arXiv:2408.12525},
  year   = {2024}
}

备注

8 pages, 7 figures, 6 tables. Published at IEEE Conference on Games, 2024