中文

面向协作智能体的策略多样性

机器学习 2023-08-29 v1 人工智能 多智能体系统

摘要

标准协作多智能体强化学习(MARL)方法旨在寻找完成某项任务的最优团队协作策略。然而,可能存在多种不同的协作方式,而这通常是领域专家所迫切需要的。因此,识别出一组显著差异的策略可为其降低任务复杂度。遗憾的是,总体上缺乏专为多智能体领域设计的有效策略多样性方法。在本工作中,我们提出一种称为矩匹配策略多样性(Moment-Matching Policy Diversity)的方法来缓解该问题。该方法通过将团队策略间的差异形式化为不同策略中所选智能体动作的差异,可生成不同程度不同的团队策略。理论上,我们证明该方法是一种简单方式,用以实现约束优化问题,即通过最大均值差异对两条轨迹分布之间的差异进行正则化。我们的方法在一个具有挑战性的团队射击游戏中得到了有效性验证。

关键词

引用

@article{arxiv.2308.14308,
  title  = {Policy Diversity for Cooperative Agents},
  author = {Mingxi Tan and Andong Tian and Ludovic Denoyer},
  journal= {arXiv preprint arXiv:2308.14308},
  year   = {2023}
}