一种求解带无人机旅行商问题的深度强化学习方法
最优化与控制
2022-12-06 v3 人工智能
机器学习
摘要
强化学习近来在许多组合优化问题中展现出学习高质量解的潜力。特别地,基于注意力的编码器-解码器模型在包括旅行商问题(TSP)在内的多种路由问题上表现出高效性。遗憾的是,它们在带无人机 TSP(TSP-D)上表现不佳,后者需要协调异构车队——一辆卡车与一架无人机——进行路由。在 TSP-D 中,两辆车 tandem 行进并可能需在节点等待另一辆车汇合。无状态的基于注意力的解码器无法实现车辆间此类协调。我们提出一种使用注意力编码器与长短期记忆(LSTM)网络解码器的混合模型,其中解码器隐藏状态可表示已执行动作序列。我们实证表明,此类混合模型在解质量与计算效率上均优于纯注意力模型。我们在最小-最大带容量车辆路由问题(mmCVRP)上的实验亦确认,混合模型比注意力模型更适于多车协调路由。所提模型展现出与运筹学基线方法可比的结果。
引用
@article{arxiv.2112.12545,
title = {A Deep Reinforcement Learning Approach for Solving the Traveling Salesman Problem with Drone},
author = {Aigerim Bogyrbayeva and Taehyun Yoon and Hanbum Ko and Sungbin Lim and Hyokun Yun and Changhyun Kwon},
journal= {arXiv preprint arXiv:2112.12545},
year = {2022}
}