学习进度驱动的多智能体课程
人工智能
2025-05-16 v3 机器学习
多智能体系统
摘要
智能体数量可作为控制多智能体强化学习(MARL)任务难度的有效课程变量。现有工作通常使用手动定义的课程,如线性方案。我们指出在 MARL 中应用现有基于奖励的自动课程学习方法的两个潜在缺陷:(1)用于衡量任务难度的期望回合回报方差高;(2)在增加智能体数量会带来更高回报的任务中(这在许多 MARL 任务中很常见),信用分配难度会加剧。为解决这些问题,我们提出通过使用基于 TD 误差的*学习进度*度量来控制课程,并让课程从初始上下文分布推进到最终特定任务分布。由于我们的方法维持智能体数量上的分布并度量学习进度而非绝对性能(后者常随智能体数量增加而上升),我们缓解了问题(2)。此外,学习进度度量通过聚合回报自然缓解了问题(1)。在三个具有挑战性的稀疏奖励 MARL 基准中,我们的方法优于最先进的基线。
引用
@article{arxiv.2205.10016,
title = {Learning Progress Driven Multi-Agent Curriculum},
author = {Wenshuai Zhao and Zhiyuan Li and Joni Pajarinen},
journal= {arXiv preprint arXiv:2205.10016},
year = {2025}
}
备注
ICML 2025