中文

基于多智能体强化学习的警局巡逻与调度联合优化

机器学习 2024-09-05 v1 最优化与控制

摘要

警察巡逻单元需要在执行预防性巡逻和被调度响应紧急事件之间分配时间。在现有文献中,巡逻和调度决策通常是分别研究的。我们考虑这两种决策的联合优化,以提高警局运营效率并缩短对紧急呼叫的响应时间。方法/结果:我们提出一种新方法,用于联合优化多智能体巡逻和调度,以学习产生快速响应时间的策略。该方法将每个巡逻者视为独立的 Q 学习智能体(agent),并使用共享深度 Q 网络表示状态-动作价值。调度决策通过混合整数规划和从组合动作空间的值函数逼近来选择。我们展示了这种异构多智能体强化学习方法能够学习出优于仅优化巡逻或调度alone policies 的联合策略。管理含义:针对巡逻和调度联合优化的政策可以导致更有效的服务,同时针对旨在提高效率和公平性等可证明灵活目标。

关键词

引用

@article{arxiv.2409.02246,
  title  = {Multi-Agent Reinforcement Learning for Joint Police Patrol and Dispatch},
  author = {Matthew Repasky and He Wang and Yao Xie},
  journal= {arXiv preprint arXiv:2409.02246},
  year   = {2024}
}