中文

利用离策略广义价值函数表示 RoboCup 3D 足球仿真中的动态角色分配

人工智能 2014-02-20 v1

摘要

在 RoboCup 3D 足球仿真这样动态、复杂、对抗且随机的环境中,收集并维护准确的世界知识是一项极具挑战性的任务。知识学习必须在实时且有时间约束的条件下进行。我们采用了强化学习中最近引入的离策略梯度下降(Off-Policy Gradient Descent)算法,展示了用于动态角色分配的可学习知识表示。结果表明,智能体已学会针对 RoboCup 2012 竞赛中的顶尖队伍制定具有竞争力的策略,适用于三对三、五对五及七对七的智能体对抗场景。我们明确使用了智能体子集来识别动态性和语义,使智能体能够学习以最大化其性能指标,并获取关于不同目标的知识,从而确保所有智能体在群体中高效且有效地参与。

关键词

引用

@article{arxiv.1402.4525,
  title  = {Off-Policy General Value Functions to Represent Dynamic Role Assignments in RoboCup 3D Soccer Simulation},
  author = {Saminda Abeyruwan and Andreas Seekircher and Ubbo Visser},
  journal= {arXiv preprint arXiv:1402.4525},
  year   = {2014}
}

备注

18 pages, 8 figures