中文

组合动作强化学习:以车辆路径问题为例

机器学习 2020-10-26 v1 人工智能 最优化与控制 机器学习

摘要

基于价值函数的方法在强化学习中长期发挥重要作用。然而,当动作空间过大而无法枚举时,给定任意复杂度的价值函数去寻找最佳下一步动作并非易事。我们开发了基于价值函数的深度强化学习框架,其具备组合动作空间,其中动作选择问题被显式表述为混合整数优化问题。作为一个 motivating 示例,我们将该框架应用于带容量约束的车辆路径问题(CVRP)——一类需由单辆容量受限车辆覆盖一组地点的组合优化问题。在每个实例上,我们将一个动作建模为单条路径的构建,并考虑通过简单策略迭代算法改进的确定性策略。我们的方法与其他强化学习方法相比具有竞争力,并在中等规模标准库实例上相对于最优 OR 方法取得 1.7% 的平均间隙。

关键词

引用

@article{arxiv.2010.12001,
  title  = {Reinforcement Learning with Combinatorial Actions: An Application to Vehicle Routing},
  author = {Arthur Delarue and Ross Anderson and Christian Tjandraatmadja},
  journal= {arXiv preprint arXiv:2010.12001},
  year   = {2020}
}