中文

用深度强化学习求解车辆路径问题

最优化与控制 2022-08-02 v1 人工智能

摘要

近年来,将强化学习(RL)方法应用于 NP 难组合优化问题已成为热门话题。这本质上源于传统组合算法常基于试错过程的特性。RL 旨在使该过程自动化。就此,本文聚焦于 RL 在车辆路径问题(VRP)——一个属于 NP 难问题类的著名组合问题——上的应用。本工作中,首先将问题建模为马尔可夫决策过程(MDP),然后应用 PPO 方法(属于 Actor-Critic 类强化学习方法)。在第二阶段,确立了 Actor 与 Critic 背后的神经架构,选择采用基于卷积神经网络的神经架构,同时用于 Actor 与 Critic。这一选择有效处理了不同规模的问题。在广泛实例上的实验表明,该算法具有良好的泛化能力,且能在短时间内得到优质解。所提算法与当前最优求解器 OR-TOOLS 的对比显示,后者仍优于该强化学习算法。然而,未来研究有望提升所提算法的现有性能。

关键词

引用

@article{arxiv.2208.00202,
  title  = {Solving the vehicle routing problem with deep reinforcement learning},
  author = {Simone Foa and Corrado Coppola and Giorgio Grani and Laura Palagi},
  journal= {arXiv preprint arXiv:2208.00202},
  year   = {2022}
}

备注

This version is really preliminary and the possibility of errors and typos is high