组合动作强化学习:以车辆路径问题为例
机器学习
2020-10-26 v1 人工智能
最优化与控制
机器学习
摘要
基于价值函数的方法在强化学习中长期发挥重要作用。然而,当动作空间过大而无法枚举时,给定任意复杂度的价值函数去寻找最佳下一步动作并非易事。我们开发了基于价值函数的深度强化学习框架,其具备组合动作空间,其中动作选择问题被显式表述为混合整数优化问题。作为一个 motivating 示例,我们将该框架应用于带容量约束的车辆路径问题(CVRP)——一类需由单辆容量受限车辆覆盖一组地点的组合优化问题。在每个实例上,我们将一个动作建模为单条路径的构建,并考虑通过简单策略迭代算法改进的确定性策略。我们的方法与其他强化学习方法相比具有竞争力,并在中等规模标准库实例上相对于最优 OR 方法取得 1.7% 的平均间隙。
引用
@article{arxiv.2010.12001,
title = {Reinforcement Learning with Combinatorial Actions: An Application to Vehicle Routing},
author = {Arthur Delarue and Ross Anderson and Christian Tjandraatmadja},
journal= {arXiv preprint arXiv:2010.12001},
year = {2020}
}