中文

面向带随机动态释放时间的定向越野问题的强化学习方法

最优化与控制 2024-05-28 v3 机器学习

摘要

在本文中,我们研究电商承运商面临的一个序贯决策问题:在包裹到达集散中心的时间具有随机性和动态性的假设下,何时从中心仓库派出车辆服务客户请求,以及以何种顺序提供服务。目标是最大化服务时段内可交付的包裹期望数量。我们提出两种强化学习(RL)方法来求解该问题。这些方法依赖于一种前瞻策略,其中以蒙特卡洛方式采样未来释放时间,并使用批量方法近似未来路径。两种 RL 方法均基于值函数近似——一种将其与共识函数结合(VFA-CF),另一种与两阶段随机整数线性规划模型结合(VFA-2S)。VFA-CF 和 VFA-2S 不需要大量训练,因为它们基于极少的超参数,并充分利用整数线性规划(ILP)和基于分支切割的精确方法以提升决策质量。我们还建立了最优策略部分刻画的充分条件,并将其集成到 VFA-CF/VFA-2S 中。在实证研究中,我们使用带完美信息的上界进行竞争分析。我们还表明 VFA-CF 和 VFA-2S 大幅优于以下替代方法:1)不依赖未来信息,或 2)基于未来信息的点估计,或 3)采用启发式而非精确方法,或 4)使用未来奖励的精确评估。

关键词

引用

@article{arxiv.2207.00885,
  title  = {Reinforcement Learning Approaches for the Orienteering Problem with Stochastic and Dynamic Release Dates},
  author = {Yuanyuan Li and Claudia Archetti and Ivana Ljubic},
  journal= {arXiv preprint arXiv:2207.00885},
  year   = {2024}
}

备注

The final version will appear in Transportation Science