不确定性信号博弈中统一分配与巡逻的强化学习
多智能体系统
2021-06-09 v1
摘要
绿色安全博弈(Green Security Games, GSGs)已成功用于保护渔业、森林和野生动物等宝贵资源。虽然实际部署涉及资源分配以及随后的协调巡逻(含通信与实时不确定信息),但以往的博弈模型并未同时充分解决这两个阶段。此外,采用现有求解策略较为困难,因为它们在更大、更复杂的博弈模型变体上可扩展性不佳。因此,我们首先提出一种新颖的 GSG 模型,该模型结合了防御者分配、巡逻、无人机向人类巡逻者实时通知,以及无人机向攻击者发送警告信号。该模型进一步在无人机与人类巡逻者团队内纳入了实时决策的不确定性。其次,我们提出 CombSGPO,一种基于强化学习的可扩展新颖算法,用于计算该博弈模型的防御者策略。CombSGPO 在多维度离散动作空间上执行策略搜索,以计算出最适配防御者最佳响应巡逻策略的分配策略,该巡逻策略通过训练多智能体 Deep Q-Network 学习得到。我们通过实验表明,CombSGPO 收敛到更优策略,且比可比方法更具可扩展性。第三,我们对 CombSGPO 学到的协调与信号行为进行了详细分析,展示了防御者资源间的群体形成以及基于资源间信号与通知的巡逻队形。重要的是,我们发现最终学到的策略中出现了战略性信号。最后,我们在不同不确定性水平下对这些策略进行了实验评估。
引用
@article{arxiv.2012.10389,
title = {Reinforcement Learning for Unified Allocation and Patrolling in Signaling Games with Uncertainty},
author = {Aravind Venugopal and Elizabeth Bondi and Harshavardhan Kamarthi and Keval Dholakia and Balaraman Ravindran and Milind Tambe},
journal= {arXiv preprint arXiv:2012.10389},
year = {2021}
}
备注
Accepted at AAMAS 2021