中文

学习协作策略求解NP难路由问题

机器学习 2021-10-28 v1 机器学习

摘要

近期,深度强化学习(DRL)框架已展现出无需问题特定专家知识即可求解如旅行商问题(TSP)等NP难路由问题的潜力。尽管DRL可用于求解复杂问题,其框架仍难以与最先进启发式方法竞争,存在显著性能差距。本文提出一种新颖的分层问题求解策略,称为学习协作策略(LCP),它利用两个迭代DRL策略——播种器与修订器——有效寻找近最优解。播种器生成尽可能多样化的候选解(种子),并致力于在完整组合动作空间(即分配动作序列)上探索。为此,我们使用简单而有效的熵正则奖励训练播种器策略,以鼓励其发现多样解。另一方面,修订器修改播种器生成的各候选解;它将完整轨迹划分为子巡回,并同时修订每个子巡回以最小化其行程距离。因此,修订器被训练为提升候选解质量,聚焦于缩减的解空间(利于利用)。大量实验表明,所提双策略协作方案在TSP、奖品收集TSP(PCTSP)和带容量车辆路由问题(CVRP)等多种NP难路由问题上优于单策略DRL框架。

关键词

引用

@article{arxiv.2110.13987,
  title  = {Learning Collaborative Policies to Solve NP-hard Routing Problems},
  author = {Minsu Kim and Jinkyoo Park and Joungho Kim},
  journal= {arXiv preprint arXiv:2110.13987},
  year   = {2021}
}

备注

NeurIPS 2021, 23 pages, 8 figures