合作巡逻路由:基于多智能体强化学习的城市犯罪监视优化
人工智能
2025-01-15 v1
摘要
巡逻策略的有效设计是一个困难且复杂的问题,尤其是在中大型区域。在本文中,我们提出了一个基于分布式部分可观测马尔可夫决策过程(MDP)的多智能体强化学习(MARL)模型,用于在表示为无向图的城市环境中规划不可预测的巡逻路线。该模型旨在最大化给定时间框架内对环境的覆盖,同时努力减少巡逻人员的数量。我们将该模型用于优化马拉加三座中型城市区的警察巡逻路线,目标是最大化对最可能犯罪发生的地区的监视覆盖,这些地区基于该市的实际犯罪数据得出。为解决此问题,研究了多种 MARL 算法,其中基于价值分解的近端策略优化(VDPPO)算法表现最佳。我们还引入了一种新指标——覆盖指数,用于评估本模型生成的路线覆盖绩效。该指标灵感来自犯罪学中常用的预测准确度指数(PAI),用于检测热点区域。使用该指标,我们在各种情景下对模型进行评估,这些情景修改了智能体(或巡逻人员)的数量、起始位置以及其在环境中可观测的水平。结果表明,我们的模型生成的协调路线能够覆盖超过 的 具有最高犯罪发生率的节点,以及 的 这些节点; 和 分别代表警察资源配置的覆盖标准。
引用
@article{arxiv.2501.08020,
title = {Cooperative Patrol Routing: Optimizing Urban Crime Surveillance through Multi-Agent Reinforcement Learning},
author = {Juan Palma-Borda and Eduardo Guzmán and María-Victoria Belmonte},
journal= {arXiv preprint arXiv:2501.08020},
year = {2025}
}