中文

面向 AI 机器人足球的两阶段训练算法

人工智能 2021-04-14 v1

摘要

在多智能体强化学习中,智能体的协作学习行为十分重要。在异构多智能体强化学习领域,追求群体中不同类型智能体之间的协作行为。在集中训练期间学习联合动作集是获得此类协作行为的一种有吸引力的方法,然而,该方法在异构智能体下带来的学习性能有限。为提升异构智能体在集中训练期间的学习性能,提出了允许对异构智能体多种角色进行训练的两阶段异构集中训练。训练过程中,依次进行两个训练过程。其中一阶段试图根据每个智能体的角色进行训练,旨在最大化个体角色奖励。另一阶段将智能体作为一个整体进行训练,使其在试图最大化共享集体奖励(如团队奖励)的同时学习协作行为。由于这两个训练过程在每个时间步中依次进行,智能体能够同时学习如何最大化角色奖励与团队奖励。所提方法应用于 5 对 5 AI 机器人足球进行验证。仿真结果表明,与其他可用于解决协作多智能体训练问题的方法相比,所提方法能有效训练机器人足球队的机器人,获得更高的角色奖励与更高的团队奖励。

关键词

引用

@article{arxiv.2104.05931,
  title  = {Two-stage training algorithm for AI robot soccer},
  author = {Taeyoung Kim and Luiz Felipe Vecchietti and Kyujin Choi and Sanem Sariel and Dongsoo Har},
  journal= {arXiv preprint arXiv:2104.05931},
  year   = {2021}
}

备注

This work is submitted to Peer J Computer Science and is currently under review. If published, we put the DOI to the paper