面向旅行警官问题的空间感知深度强化学习
机器学习
2024-01-12 v1 人工智能
摘要
旅行警官问题(TOP)是一项具有挑战性的随机优化任务。在该问题中,一名停车执法警官被引导穿过配备停车传感器的城市,以尽可能多地处罚违规停车者。TOP 的一个主要挑战是停车违规行为的动态特性,即违规行为会随机出现并在一定时间后消失,无论其是否已被处罚。因此,解决方案需要动态调整以适应当前可处罚的停车违规行为,同时提前规划以增加警官在违规行为发生期间到达的可能性。尽管已有多种解决方案,但这些方法往往难以考虑行动对未来处罚违规停车能力的影响。本文提出了 SATOP,一种新颖的面向 TOP 的空间感知深度强化学习方法。我们新颖的状态编码器利用停车位、智能体和行动之间的空间关系,创建每个行动的表示。此外,我们提出了一个新颖的消息传递模块,用于学习给定环境中未来的行动间关联。因此,智能体可以估计执行某个行动后进一步处罚违规停车的潜力。我们使用基于墨尔本真实数据的环境评估了我们的方法。结果表明,SATOP 持续优于最先进的 TOP 智能体,并且能够多处罚高达 22% 的停车违规行为。
引用
@article{arxiv.2401.05969,
title = {Spatial-Aware Deep Reinforcement Learning for the Traveling Officer Problem},
author = {Niklas Strauß and Matthias Schubert},
journal= {arXiv preprint arXiv:2401.05969},
year = {2024}
}
备注
SIAM SDM 2024