RLOR:面向运筹学的深度强化学习灵活框架
最优化与控制
2023-03-24 v1 机器学习
神经与进化计算
摘要
强化学习已应用于运筹学,并在解决大型组合优化问题中展现出前景。然而,现有工作侧重于为特定问题开发神经网络架构。这些工作缺乏融入强化学习近期进展的灵活性,也缺乏为运筹学问题定制模型架构的灵活性。在本工作中,我们分析了针对车辆路径问题的端到端自回归模型,表明通过谨慎地重新实现模型架构,这些模型可受益于强化学习的近期进展。具体而言,我们重新实现了Attention Model并在CleanRL中用Proximal Policy Optimization (PPO)训练它,显示出训练时间至少加速8倍。我们由此引入RLOR,一个面向运筹学的深度强化学习灵活框架。我们相信灵活的框架是开发运筹学问题深度强化学习模型的关键。我们的工作代码公开于 https://github.com/cpwan/RLOR。
引用
@article{arxiv.2303.13117,
title = {RLOR: A Flexible Framework of Deep Reinforcement Learning for Operation Research},
author = {Ching Pui Wan and Tung Li and Jason Min Wang},
journal= {arXiv preprint arXiv:2303.13117},
year = {2023}
}
备注
21 pages