基于图指针网络与分层强化学习的组合优化
机器学习
2019-11-13 v1 机器学习
摘要
本工作中,我们引入使用强化学习(RL)训练的图指针网络(GPNs)以应对旅行商问题(TSP)。GPNs在指针网络基础上引入对输入的图嵌入层,以捕获节点间关系。此外,为近似求解带时间窗TSP等约束组合优化问题,我们使用RL训练分层GPNs(HGPNs),其学习一种分层策略以在约束下寻找最优城市排列。分层的每一层设计有独立的奖励函数,从而实现稳定训练。我们的结果表明,在小型TSP50/100问题上训练的GPNs能很好地泛化到更大规模的TSP500/1000问题,且具有更短的巡回长度与更快的计算时间。我们验证,对于带时间窗TSP等约束TSP问题,通过分层RL训练找到的可行解优于先前基线。本着可复现研究的精神,我们公开提供数据、模型与代码。
引用
@article{arxiv.1911.04936,
title = {Combinatorial Optimization by Graph Pointer Networks and Hierarchical Reinforcement Learning},
author = {Qiang Ma and Suwen Ge and Danyang He and Darshan Thaker and Iddo Drori},
journal= {arXiv preprint arXiv:1911.04936},
year = {2019}
}