中文

面向稀疏奖励协作多智能体问题的变分自动课程学习

机器学习 2023-12-12 v2 多智能体系统

摘要

我们引入一种课程学习算法——变分自动课程学习(VACL),用于求解具有挑战性的目标条件协作多智能体强化学习问题。我们通过变分视角阐释我们的范式:学习目标可分解为两项,当前任务分布上的任务学习,以及向新任务分布的课程更新。对第二项的局部优化表明,课程应从易到难逐步扩展训练任务。我们的 VACL 算法以任务扩展与实体递进两个实用组件实现该变分范式,在任务配置及任务中实体数量上生成训练课程。实验结果表明,VACL 求解了一系列含大量智能体的稀疏奖励问题。特别地,在单台台式机上,VACL 在 simple-spread 基准中以 100 个智能体取得 98% 覆盖率,并复现了 OpenAI hide-and-seek 项目中最初展示的坡道使用行为。我们的项目网站位于 https://sites.google.com/view/vacl-neurips-2021。

关键词

引用

@article{arxiv.2111.04613,
  title  = {Variational Automatic Curriculum Learning for Sparse-Reward Cooperative Multi-Agent Problems},
  author = {Jiayu Chen and Yuanxin Zhang and Yuanfan Xu and Huimin Ma and Huazhong Yang and Jiaming Song and Yu Wang and Yi Wu},
  journal= {arXiv preprint arXiv:2111.04613},
  year   = {2023}
}

备注

In NeurIPS 2021