AdverSAR:基于多智能体强化学习的对抗式搜索与救援
机器人学
2022-12-21 v1 机器学习
多智能体系统
系统与控制
系统与控制
最优化与控制
摘要
偏远环境中的搜索与救援(SAR)任务常采用自主多机器人系统,其学习、规划并执行局部单机器人控制动作、群体原语以及全局任务导向协调与协作的组合。SAR协调策略通常由可远程控制多机器人系统并实现半自主操作的人类专家手动设计。然而,在连通性受限且常无法进行人工干预的偏远环境中,需要分散式协作策略以实现全自主操作。尽管如此,由于传感器噪声、执行故障或智能体间通信数据被篡改,分散式协调在对抗环境中可能失效。本文提出一种基于对抗式多智能体强化学习(MARL)的算法方法,使机器人在存在对抗式智能体间通信时能有效协调其策略。在我们的设定中,多机器人团队的目标是在障碍遍布的地理区域中通过最小化发现目标的平均时间来实现战略性目标发现。假设机器人事先不知目标位置,且任意时刻仅能与部分邻近机器人交互。基于MARL中的集中训练分散执行(CTDE)范式,我们利用分层元学习框架学习动态团队协调模式,并发现复杂合作-竞争场景下的涌现团队行为。我们方法的有效性在一系列具有不同良性与对抗智能体、目标位置及智能体奖励设定的原型网格世界环境中得到验证。
引用
@article{arxiv.2212.10064,
title = {AdverSAR: Adversarial Search and Rescue via Multi-Agent Reinforcement Learning},
author = {Aowabin Rahman and Arnab Bhattacharya and Thiagarajan Ramachandran and Sayak Mukherjee and Himanshu Sharma and Ted Fujimoto and Samrat Chatterjee},
journal= {arXiv preprint arXiv:2212.10064},
year = {2022}
}