低复杂度模块化策略:学习玩 Pac-Man 及超越 MDP 的新框架
机器学习
2007-05-23 v1 人工智能
摘要
本文提出了一种学习玩 Pac-Man 的方法。我们定义了一组高层次的观察和动作模块。动作是时延扩展的,且多个动作模块可能同时生效。代理的决策表示为基于规则的策略。对于学习,我们应用了交叉熵方法,这是一种最近的全局优化算法。所学得的策略的得分优于手工制作的策略,并且接近平均人类玩家的得分。我们认为,学习主要成功是因为 (i) 策略空间包含单个动作的组合,因此足够丰富, (ii) 搜索偏向低复杂度策略,低复杂度解决方案如果存在的话可以快速找到。基于这些原则,我们提出了一个新的理论框架,可在附录中作为支持材料找到。
引用
@article{arxiv.cs/0610170,
title = {Low-complexity modular policies: learning to play Pac-Man and a new framework beyond MDPs},
author = {Istvan Szita and Andras Lorincz},
journal= {arXiv preprint arXiv:cs/0610170},
year = {2007}
}
备注
23 pages