RAST-MoE-RL:一种面向网约车深度强化学习的状态感知时空混合专家框架
机器学习
2026-05-05 v2
摘要
网约车平台面临在高度不确定的供需条件下平衡乘客等待时间与整体系统效率的挑战。自适应延迟匹配控制了批量请求和车辆的保持间隔,揭示了匹配延迟与接载延迟之间的固有权衡。由此产生的具有时变请求到达模式和动态拥堵的环境,需要更具表达能力的网络来捕捉其非平稳性。为解决现有方法依赖浅层编码器、无法捕捉动态供需模式和拥堵效应的局限性,我们引入了RAST-MoE(状态感知时空混合专家)框架,将自适应延迟匹配形式化为状态感知马尔可夫决策过程,并为RL智能体配备了自注意力MoE编码器。我们的设计不依赖单一的整体网络,而是允许不同专家在不同运行条件下自动专业化,在保持每样本计算效率的同时提升表示能力。尽管仅有12M参数的适度规模,我们的框架持续优于强基线方法。在来自旧金山的真实Uber轨迹数据上,它将平均匹配延迟降低了10%,接载延迟降低了15%。此外,它展现出对未见需求状态的鲁棒性、无奖励博弈的稳定训练行为,以及专家对不同状态的专业化。本研究展示了混合专家增强强化学习在具有复杂时空动力学的大规模决策任务中的优势。
引用
@article{arxiv.2512.13727,
title = {RAST-MoE-RL: A Regime-Aware Spatio-Temporal MoE Framework for Deep Reinforcement Learning in Ride-Hailing},
author = {Yuhan Tang and Kangxin Cui and Jung Ho Park and Yibo Zhao and Xuan Jiang and Haoze He and Jiangbo Yu and Haris Koutsopoulos and Jinhua Zhao},
journal= {arXiv preprint arXiv:2512.13727},
year = {2026}
}