中文

面向路由问题的基于探索的样本高效策略优化

机器学习 2022-06-01 v1

摘要

基于无模型深度强化学习的算法已被应用于一系列组合优化问题(COPs)。然而,这些方法在应用于组合问题时面临两个关键挑战:探索不足,以及需要大量搜索空间的训练样本才能达到合理性能。组合优化可能很复杂,其特征是具有许多最优解和巨大搜索与学习空间。因此,需要一种通过提高样本效率来更高效地找到良好解的新方法。本文提出了一种基于熵的新的强化学习方法。此外,我们设计了一种离策略强化学习技术,最大化期望回报并提高样本效率,以在训练时实现更快的学习。我们在通常用于评估基于学习的优化的若干路由优化任务上系统评估了我们的方法,例如旅行商问题(TSP)、带容量约束的车辆路径问题(CVRP)。在本文中,我们展示了我们的模型可泛化到多种路由问题,如分送车辆路径问题(SDVRP),并将我们的方法性能与当前最先进(SOTA)方法进行比较。实证结果表明,所提方法在解质量和计算时间上均优于最先进方法,并可泛化到不同规模的问题。

关键词

引用

@article{arxiv.2205.15656,
  title  = {Sample-Efficient, Exploration-Based Policy Optimisation for Routing Problems},
  author = {Nasrin Sultana and Jeffrey Chan and Tabinda Sarwar and A. K. Qin},
  journal= {arXiv preprint arXiv:2205.15656},
  year   = {2022}
}