多智能体深度覆盖技能发现
机器学习
2023-09-22 v3 多智能体系统
摘要
技能(又称选项,options)的使用可极大加速强化学习中的探索,尤其在仅有稀疏奖励信号可用时。尽管已提出针对单个智能体的选项发现方法,但在多智能体强化学习(MARL)设置中,发现能够协调多个智能体行为并促使它们访问联合状态空间中未被充分探索区域的协作选项尚未被考虑。对此,我们提出多智能体深度覆盖选项发现(Multi-agent Deep Covering Option Discovery),其通过最小化多个智能体联合状态空间的期望覆盖时间构建多智能体选项。同时,我们提出一种新颖框架以在 MARL 过程中采用多智能体选项。实践中,多智能体任务通常可划分为若干子任务,每个子任务可由智能体的一个子组完成。因此,我们的算法框架首先利用注意力机制找出最受益于协调动作的协作智能体子组。随后,开发了一种称为 HA-MSAC 的分层算法,为每个子组学习多智能体选项以先完成其子任务,再通过高层策略将其整合作为整个任务的求解方案。这种分层选项构建使我们的框架在可扩展性与智能体间有效协作之间取得平衡。基于多智能体协作任务的评估表明,所提算法能通过注意力机制有效捕捉智能体交互,成功识别多智能体选项,并在更快探索和更高任务奖励方面显著优于使用单智能体选项或无选项的已有工作。
引用
@article{arxiv.2210.03269,
title = {Multi-agent Deep Covering Skill Discovery},
author = {Jiayu Chen and Marina Haliem and Tian Lan and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2210.03269},
year = {2023}
}
备注
This paper was presented in part at the ICML Reinforcement Learning for Real Life Workshop, July 2021