对抗性多智能体系统中协作行为的学习
人工智能
2023-02-14 v1 多智能体系统
机器人学
摘要
本工作扩展了现有的名为 RoboSumo 的虚拟多智能体平台,创建了 TripleSumo——一个用于研究连续动作空间中、在对抗环境下存在物理接触的智能体间协作行为的平台。在本文中,我们研究了一个场景,其中两个智能体,即“Bug”和“Ant”,必须组队并将另一个智能体“Spider”推出竞技场。为达成这一目标,新加入的智能体“Bug”在“Ant”与“Spider”进行中的对抗赛期间接受训练。“Bug”必须发展对其他智能体动作的感知,推断双方的策略,并最终学习一种用于协作的动作策略。强化学习算法 Deep Deterministic Policy Gradient (DDPG) 以结合稠密与稀疏奖励的混合奖励结构实现。协作行为通过获胜的平均概率以及获胜所需的平均步数进行定量评估。
引用
@article{arxiv.2302.05528,
title = {Learning cooperative behaviours in adversarial multi-agent systems},
author = {Ni Wang and Gautham P. Das and Alan G. Millard},
journal= {arXiv preprint arXiv:2302.05528},
year = {2023}
}
备注
23rd Annual Conference, Towards Autonomous Robotic Systems 2022