用强化学习求解 NP 难问题:在 CVRP 上的应用
人工智能
2022-01-17 v1 机器学习
摘要
本文中,我们评估了使用强化学习(RL)求解经典组合优化问题:带容量约束的车辆路径问题(CVRP)的效用。我们在 RL 框架下形式化该问题,并在一组基准实例上将两种最有前景的 RL 方法与传统求解技术进行比较。我们以返回解的质量与返回所需时间衡量不同方法。我们发现尽管未返回最优解,RL 方法相较传统求解器具有诸多优势。首先,该框架的通用性允许求解更复杂的组合问题。此外,RL 算法学习的是求解问题所需的技能,而非试图求解问题的特定实例。训练所得策略随后可近乎即时地为未见过的问题提供解,而无需从头求解。最后,训练模型的使用使 RL 求解器远为最快,因此使该方法更适于用户体验至关重要的商业应用。诸如知识迁移等技术也可用于提升算法训练效率并助力求解更大更复杂的问题。
引用
@article{arxiv.2201.05393,
title = {Reinforcement Learning to Solve NP-hard Problems: an Application to the CVRP},
author = {Leo Ardon},
journal= {arXiv preprint arXiv:2201.05393},
year = {2022}
}