中文

DRL4Route:一种用于取送路线预测的深层强化学习框架

机器学习 2023-08-01 v1 人工智能

摘要

取送路线预测(PDRP)旨在给定工人当前任务池估计其未来服务路线,近年来受到越来越多关注。基于监督学习的深度神经网络因能从海量历史数据中捕捉工人行为模式而成为该任务的主导模型。尽管前景良好,它们未能将不可微的测试准则引入训练过程,导致训练与测试准则不匹配。这在应用于实际系统时显著降低了其性能。为解决上述问题,我们首次尝试将强化学习(RL)推广到路线预测任务,提出了一种新颖的基于RL的框架DRL4Route。它结合了先前深度学习模型的行为学习能力与强化学习的不可微目标优化能力。DRL4Route可作为即插即用组件以提升现有深度学习模型。基于该框架,我们进一步实现了一种名为DRL4Route-GAE的模型用于物流服务的PDRP。它遵循actor-critic架构,并配备广义优势估计器以平衡策略梯度估计的偏差与方差,从而获得更优策略。大量离线实验与在线部署表明,在真实世界数据集上,DRL4Route-GAE相较现有方法将位置平方偏差(LSD)提升0.9%-2.7%,将Accuracy@3(ACC@3)提升2.4%-3.2%。

关键词

引用

@article{arxiv.2307.16246,
  title  = {DRL4Route: A Deep Reinforcement Learning Framework for Pick-up and Delivery Route Prediction},
  author = {Xiaowei Mao and Haomin Wen and Hengrui Zhang and Huaiyu Wan and Lixia Wu and Jianbin Zheng and Haoyuan Hu and Youfang Lin},
  journal= {arXiv preprint arXiv:2307.16246},
  year   = {2023}
}

备注

Accepted by KDD23