中文

绿色安全下基于极小极大后悔的鲁棒强化学习

机器学习 2021-06-17 v1 人工智能 多智能体系统

摘要

绿色安全领域的防御者面对偷猎者、非法伐木者和非法捕鱼者对抗行为的不确定性来规划巡逻。重要的是,巡逻对对手未来行为的威慑效应使巡逻规划成为序贯决策问题。因此,我们关注绿色安全下遵循极小极大后悔准则的鲁棒序贯巡逻规划,这在文献中尚未被考虑。我们将该问题建模为防御者与自然之间的博弈,自然控制对抗行为的参数值,并设计算法 MIRROR 以寻找鲁棒策略。MIRROR 使用两个基于强化学习的预言机,并求解考虑有限防御者策略和参数值的受限博弈。我们在真实世界偷猎数据上评估了 MIRROR。

关键词

引用

@article{arxiv.2106.08413,
  title  = {Robust Reinforcement Learning Under Minimax Regret for Green Security},
  author = {Lily Xu and Andrew Perrault and Fei Fang and Haipeng Chen and Milind Tambe},
  journal= {arXiv preprint arXiv:2106.08413},
  year   = {2021}
}

备注

Accepted at the Conference on Uncertainty in Artificial Intelligence (UAI) 2021. 11 pages, 5 figures