中文

基于核方法学习 RoboCup 控球策略

人工智能 2012-02-01 v1 机器学习 多智能体系统

摘要

我们应用基于核的方法来解决 RoboCup 仿真足球中困难的 3 对 2 控球(keepaway)强化学习问题。控球策略的关键挑战包括:状态空间的高维性(使得基于离散化的函数逼近方法如瓦片编码不可行)、由于噪声和多个智能体需要协作而产生的随机性(意味着环境的确切动力学未知),以及实时学习(意味着需要高效的在线实现)。我们采用了基于最小二乘策略评估的近似策略迭代通用框架。作为底层函数逼近器,我们考虑了具有回归子集逼近的正则化网络族。我们提出解决方案的核心是一种高效的递归实现,能够自动监督选择相关基函数。仿真结果表明,通过我们的方法学习到的行为明显优于 Stone 等人(2005)此前使用瓦片编码获得的最佳结果。

关键词

引用

@article{arxiv.1201.6626,
  title  = {Learning RoboCup-Keepaway with Kernels},
  author = {Tobias Jung and Daniel Polani},
  journal= {arXiv preprint arXiv:1201.6626},
  year   = {2012}
}