基于核方法学习 RoboCup 控球策略
人工智能
2012-02-01 v1 机器学习
多智能体系统
摘要
我们应用基于核的方法来解决 RoboCup 仿真足球中困难的 3 对 2 控球(keepaway)强化学习问题。控球策略的关键挑战包括:状态空间的高维性(使得基于离散化的函数逼近方法如瓦片编码不可行)、由于噪声和多个智能体需要协作而产生的随机性(意味着环境的确切动力学未知),以及实时学习(意味着需要高效的在线实现)。我们采用了基于最小二乘策略评估的近似策略迭代通用框架。作为底层函数逼近器,我们考虑了具有回归子集逼近的正则化网络族。我们提出解决方案的核心是一种高效的递归实现,能够自动监督选择相关基函数。仿真结果表明,通过我们的方法学习到的行为明显优于 Stone 等人(2005)此前使用瓦片编码获得的最佳结果。
引用
@article{arxiv.1201.6626,
title = {Learning RoboCup-Keepaway with Kernels},
author = {Tobias Jung and Daniel Polani},
journal= {arXiv preprint arXiv:1201.6626},
year = {2012}
}