基于协调策略优化学习模拟自驱动粒子系统
机器学习
2022-01-11 v2
摘要
自驱动粒子(SDP)描述一类日常生活中常见的多智能体系统,如鸟群与交通流。在SDP系统中,每个智能体追求自身目标,并不断改变其与邻近智能体的合作或竞争行为。为此类SDP系统手动设计控制器耗时费力,且由此产生的涌现行为往往既不真实也不可泛化。因此SDP系统的真实模拟仍具挑战。强化学习为自动化开发SDP控制器提供了诱人替代方案。然而,以往多智能体强化学习(MARL)方法预先将智能体定义队友或敌人,未能捕捉SDP本质——其中每个智能体的角色甚至在同一回合内也会在合作与竞争间变化。为用MARL模拟SDP,关键挑战在于协调智能体行为的同时仍最大化个体目标。以交通模拟为测试平台,本文提出一种称为协调策略优化(CoPO)的新型MARL方法,其结合社会心理学原理来学习SDP的神经控制器。实验表明,所提方法在各指标上均优于MARL基线。值得注意的是,受训车辆展现出复杂多样的社会行为,提升了整体的性能与安全。演示视频与源代码见:https://decisionforce.github.io/CoPO/
引用
@article{arxiv.2110.13827,
title = {Learning to Simulate Self-Driven Particles System with Coordinated Policy Optimization},
author = {Zhenghao Peng and Quanyi Li and Ka Ming Hui and Chunxiao Liu and Bolei Zhou},
journal= {arXiv preprint arXiv:2110.13827},
year = {2022}
}
备注
Accepted to NeurIPS 2021. Code and video can be found at: https://decisionforce.github.io/CoPO/