D$^3$-Subsidy:面向大规模网约车市场的在线序列化司机补贴决策
机器学习
2026-05-22 v3
摘要
像滴滴出行这样的网约车平台在高度动态的环境中运营,平衡司机供给与乘客需求至关重要。尽管司机侧补贴是协调这些力量并改善关键 KPI(如完单量 (\texttt{Rides}) 和总交易额 (\texttt{GMV}))的主要杠杆,但在生产环境中优化它们需要同时满足三个约束:(i) 对随机冲击的响应能力,(ii) 严格的补贴率上限,以及 (iii) 城市规模下的低延迟执行。这些要求排除了昂贵的逐单优化,呼唤一种用于在线序列决策的、具有前瞻性且考虑约束的城市级控制器。为满足这些要求,我们引入了 D-Subsidy(基于动态司机侧扩散的补贴),一个用于可部署城市级补贴控制的分层扩散框架。为弥合训练与推理之间的差距,D-Subsidy 采用了一个前缀条件扩散模型,该模型从不可变的历史观测中采样合理的未来轨迹,确保训练协议与在线部署的固定历史特性保持一致。然后,这些生成的计划由一个上下文条件逆模块解码为低维的城市级控制信号。为实现可扩展执行,我们通过拉格朗日对偶导出的映射弥合了城市级规划与细粒度调度之间的差距,该映射将补贴率上限直接嵌入到订单-司机激励中,无需迭代优化。此外,一种带参数高效微调的多城市预训练策略,实现了跨异构城市的鲁棒迁移。广泛的离线评估表明,D-Subsidy 在提高 \texttt{Rides} 和 \texttt{GMV} 的同时增强了上限合规性,并且一次真实世界的 A/B 测试证实了显著的提升,同时将与预算相关的违规指标保持在运营阈值之内。
引用
@article{arxiv.2605.20036,
title = {D$^3$-Subsidy: Online and Sequential Driver Subsidy Decision-Making for Large-Scale Ride-Hailing Market},
author = {Taijie Chen and Rui Su and Siyuan Feng and Laoming Zhang and Hongyang Zhang and Haijiao Wang and Zhaofeng Ma and Jintao Ke and Li Ma},
journal= {arXiv preprint arXiv:2605.20036},
year = {2026}
}
备注
14 pages, 14 figures