中文

RLOR:面向运筹学的深度强化学习灵活框架

最优化与控制 2023-03-24 v1 机器学习 神经与进化计算

摘要

强化学习已应用于运筹学,并在解决大型组合优化问题中展现出前景。然而,现有工作侧重于为特定问题开发神经网络架构。这些工作缺乏融入强化学习近期进展的灵活性,也缺乏为运筹学问题定制模型架构的灵活性。在本工作中,我们分析了针对车辆路径问题的端到端自回归模型,表明通过谨慎地重新实现模型架构,这些模型可受益于强化学习的近期进展。具体而言,我们重新实现了Attention Model并在CleanRL中用Proximal Policy Optimization (PPO)训练它,显示出训练时间至少加速8倍。我们由此引入RLOR,一个面向运筹学的深度强化学习灵活框架。我们相信灵活的框架是开发运筹学问题深度强化学习模型的关键。我们的工作代码公开于 https://github.com/cpwan/RLOR。

关键词

引用

@article{arxiv.2303.13117,
  title  = {RLOR: A Flexible Framework of Deep Reinforcement Learning for Operation Research},
  author = {Ching Pui Wan and Tung Li and Jason Min Wang},
  journal= {arXiv preprint arXiv:2303.13117},
  year   = {2023}
}

备注

21 pages