状态空间闭包:基于强化学习重访无尽在线关卡生成
人工智能
2023-03-27 v2
摘要
本文中,我们利用近期提出的经验驱动式通过强化学习的程序化内容生成(EDRL)框架,重访无尽在线关卡生成。受 EDRL 倾向于生成重复模式的观察启发,我们形式化了状态空间闭包这一概念,其使得无限 horizon 在线生成过程中可能出现的任何随机状态都能在有限 horizon 内被发现。通过理论分析,我们发现尽管状态空间闭包引发了关于多样性的担忧,但它将有限 horizon 训练的 EDRL 推广到无限 horizon 场景而不损害内容质量。此外,我们在广泛使用的超级马里奥兄弟基准上通过实证研究验证了 EDRL 生成内容的质量与多样性。实验结果显示,由于状态空间闭包,EDRL 生成关卡的多样性受限,而其质量在长于训练指定 horizon 的区间内并未退化。综合我们的结果与分析,未来关于通过强化学习的无尽在线关卡生成应在保证状态空间闭包发生与质量的同时解决多样性问题。
引用
@article{arxiv.2212.02951,
title = {State Space Closure: Revisiting Endless Online Level Generation via Reinforcement Learning},
author = {Ziqi Wang and Tianye Shu and Jialin Liu},
journal= {arXiv preprint arXiv:2212.02951},
year = {2023}
}
备注
Accepted by the IEEE Transactions on Games