中文

基于封建式分层强化学习的房间清剿

机器学习 2021-05-25 v1 人工智能

摘要

强化学习(RL)是一种通用框架,使系统能够通过与环境试错交互自主地学习。近年来,将RL与具有强表达力、高容量的神经网络模型相结合,在众多不同领域中取得了令人印象深刻的性能。然而,处理现实世界问题通常所需的大状态空间与动作空间仍是一项重大挑战。本文引入一个新的仿真环境“Gambit”,旨在作为构建场景的工具,以推动RL研究朝着对军事分析有用的方向发展。利用该环境,我们聚焦于一个抽象且简化的房间清剿场景:一队蓝方智能体须穿行建筑物并确保所有房间清除(并保持清除)敌方红方智能体。我们实现了一种多智能体版本的封建式分层RL,引入指挥层级,其中高层指挥官向低层多个智能体发送指令,后者只需学会遵从这些指令。我们发现,以这种方式分解任务,使我们能够比所对比的标准基线RL算法更高效求解若干需要多智能体协调的非平凡平面图。进而,我们探究根据智能体奖励函数中所优先目标的不同(例如快速清剿建筑物 vs. 优先营救平民),会涌现出何种质上不同的行为。

关键词

引用

@article{arxiv.2105.11328,
  title  = {Room Clearance with Feudal Hierarchical Reinforcement Learning},
  author = {Henry Charlesworth and Adrian Millea and Eddie Pottrill and Rich Riley},
  journal= {arXiv preprint arXiv:2105.11328},
  year   = {2021}
}