基于离线深度强化学习的网约车服务时空激励优化
机器学习
2022-11-08 v1 系统与控制
系统与控制
摘要
在任何点对点拼车系统中,一个根本性问题是如何既有效又高效地满足乘客请求以实时平衡供需。在乘客侧,传统方法聚焦于定价策略,通过提高用户呼叫的概率来调整需求分布。然而,先前的方法未考虑策略变化对未来供需变化的影响,这意味着由于乘客呼叫,司机被重新定位到不同目的地,这将影响司机未来一段时间的收入。受此观察启发,我们尝试通过学习的长期时空价值作为定价策略的指导原则来优化需求分布以处理该问题。在本研究中,我们提出一种基于离线深度强化学习、聚焦需求侧的方法,以提升交通资源利用率与客户满意度。我们采用时空学习方法学习不同时间与地点的价值,进而激励乘客的乘车请求以调整需求分布,平衡系统中的供需。特别地,我们将该问题建模为马尔可夫决策过程(MDP)。
引用
@article{arxiv.2211.03240,
title = {Spatio-temporal Incentives Optimization for Ride-hailing Services with Offline Deep Reinforcement Learning},
author = {Yanqiu Wu and Qingyang Li and Zhiwei Qin},
journal= {arXiv preprint arXiv:2211.03240},
year = {2022}
}