面向订单派单中强化学习的模式迁移学习
机器学习
2022-02-28 v2
摘要
订单派单是网约车平台的核心问题之一。近年来,基于价值的强化学习算法在该问题上展现出了良好的性能。然而,在真实应用中,供需系统的非平稳性给复用不同时间段生成的数据来学习价值函数带来了挑战。在本工作中,鉴于某些状态价值之间的相对关系在各种环境中大体稳定这一事实,我们提出了一种用于订单派单问题中基于价值的强化学习的模式迁移学习框架。我们的方法通过引入一致性惩罚高效地捕捉价值模式。所提方法的优越性能得到了实验的支持。
引用
@article{arxiv.2105.13218,
title = {Pattern Transfer Learning for Reinforcement Learning in Order Dispatching},
author = {Runzhe Wan and Sheng Zhang and Chengchun Shi and Shikai Luo and Rui Song},
journal= {arXiv preprint arXiv:2105.13218},
year = {2022}
}
备注
Spotlight paper, RL4ITS, IJCAI-21