学习协作策略求解NP难路由问题
机器学习
2021-10-28 v1 机器学习
摘要
近期,深度强化学习(DRL)框架已展现出无需问题特定专家知识即可求解如旅行商问题(TSP)等NP难路由问题的潜力。尽管DRL可用于求解复杂问题,其框架仍难以与最先进启发式方法竞争,存在显著性能差距。本文提出一种新颖的分层问题求解策略,称为学习协作策略(LCP),它利用两个迭代DRL策略——播种器与修订器——有效寻找近最优解。播种器生成尽可能多样化的候选解(种子),并致力于在完整组合动作空间(即分配动作序列)上探索。为此,我们使用简单而有效的熵正则奖励训练播种器策略,以鼓励其发现多样解。另一方面,修订器修改播种器生成的各候选解;它将完整轨迹划分为子巡回,并同时修订每个子巡回以最小化其行程距离。因此,修订器被训练为提升候选解质量,聚焦于缩减的解空间(利于利用)。大量实验表明,所提双策略协作方案在TSP、奖品收集TSP(PCTSP)和带容量车辆路由问题(CVRP)等多种NP难路由问题上优于单策略DRL框架。
引用
@article{arxiv.2110.13987,
title = {Learning Collaborative Policies to Solve NP-hard Routing Problems},
author = {Minsu Kim and Jinkyoo Park and Joungho Kim},
journal= {arXiv preprint arXiv:2110.13987},
year = {2021}
}
备注
NeurIPS 2021, 23 pages, 8 figures