中文

提升基于深度强化学习的 TSP 求解器的泛化能力

机器学习 2021-10-07 v1 人工智能

摘要

近期将深度强化学习(DRL)应用于求解旅行商问题(TSP)的工作表明,基于 DRL 的求解器对于小规模实例可快速且与 TSP 启发式算法具有竞争力,但对更大规模实例泛化不佳。本工作中,我们提出一种名为 MAGIC 的新方法,包含深度学习架构与 DRL 训练方法。我们的架构集成了多层感知机、图神经网络与注意力模型,定义了顺序生成 TSP 解随机策略。我们的训练方法包含若干创新:(1)我们将 DRL 策略梯度更新与局部搜索(使用一种新局部搜索技术)交错进行;(2)我们使用一种新颖简单基线;(3)我们应用课程学习。最后,我们经实证证明,在随机 TSP 实例上,MAGIC 在性能与可泛化性方面均优于其他基于 DRL 的方法。此外,在性能与计算时间方面,我们的方法相较 TSP 启发式算法及其他最先进方法更具优势。

关键词

引用

@article{arxiv.2110.02843,
  title  = {Improving Generalization of Deep Reinforcement Learning-based TSP Solvers},
  author = {Wenbin Ouyang and Yisen Wang and Shaochen Han and Zhejian Jin and Paul Weng},
  journal= {arXiv preprint arXiv:2110.02843},
  year   = {2021}
}

备注

8 pages, 2 figures