中文

一种求解带时间窗定向越野问题的强化学习方法

机器学习 2021-07-01 v2

摘要

带时间窗定向越野问题(OPTW)是一类组合优化问题,目标是最大化从所访问不同地点收集的总得分。神经网络模型在组合优化中的应用最近在处理类似问题(如旅行商问题)上展现出有前景的结果。神经网络允许使用强化学习或监督学习来学习解,取决于可用数据。在学习阶段之后,它可以被泛化并快速微调以进一步提升性能与个性化。其优势显而易见,因为对于现实应用而言,解质量、个性化与执行时间都是应被考量的重要因素。本研究探索使用基于强化学习训练的 Pointer Network 模型来求解 OPTW 问题。我们提出了一种改进架构,利用 Pointer Network 更好地处理与动态时间相关约束有关的问题。在众多应用中,OPTW 可用于建模游客行程设计问题(TTDP)。我们以 TTDP 问题为出发点训练 Pointer Network,通过采样跨游客访问特定实例区域时可变的变量:起始位置、起始时间、可用时间与各兴趣点给定得分。一旦模型-区域被训练好,它可使用 beam search 推断特定游客的解。我们基于多个现有基准 OPTW 实例评估了方法。我们表明它能跨访问各区域的不同游客泛化,且通常优于最常用启发式方法,同时在现实时间内计算出解。

关键词

引用

@article{arxiv.2011.03647,
  title  = {A Reinforcement Learning Approach to the Orienteering Problem with Time Windows},
  author = {Ricardo Gama and Hugo L. Fernandes},
  journal= {arXiv preprint arXiv:2011.03647},
  year   = {2021}
}