中文

基于示范数据的样本高效多智能体强化学习及其在集群控制中的应用

机器学习 2022-09-20 v1 人工智能 多智能体系统 机器人学

摘要

集群控制是多智能体系统(如多智能体无人机与多智能体自主水下航行器)中的重要问题,可增强智能体的协作性与安全性。相比传统方法,多智能体强化学习(MARL)更灵活地解决集群控制问题。然而,基于 MARL 的方法存在样本效率低的问题,因其需从智能体与环境的交互中收集海量经验。我们提出一种新方法——基于示范数据的 MARL 预训练(PwD-MARL),其可利用传统方法预先收集的非专家示范数据对智能体进行预训练。在预训练过程中,智能体同时通过 MARL 与行为克隆从示范中学习策略,并被防止对示范过拟合。通过非专家示范预训练,PwD-MARL 以热启动方式提升了在线 MARL 过程中的样本效率。实验表明,即便在示范质量差或数量少的情况下,PwD-MARL 仍能在集群控制问题中提升样本效率与策略性能。

关键词

引用

@article{arxiv.2209.08351,
  title  = {Sample-Efficient Multi-Agent Reinforcement Learning with Demonstrations for Flocking Control},
  author = {Yunbo Qiu and Yuzhu Zhan and Yue Jin and Jian Wang and Xudong Zhang},
  journal= {arXiv preprint arXiv:2209.08351},
  year   = {2022}
}

备注

Accepted by IEEE Vehicular Technology Conference (VTC) 2022-Fall