基于条件期望的价值分解用于可扩展按需拼车
机器学习
2021-12-02 v1 人工智能
计算机与社会
多智能体系统
摘要
由于对乘客(更低价格)、司机(更高收入)、聚合公司(更高收入)和环境(更少车辆)的益处,按需拼车(如 Uber pool、Grab Share)已变得相当流行。将车辆与请求组合进行匹配的极高计算复杂度意味着传统拼车方法是短视的,即不考虑当前匹配对车辆/司机未来价值的影响。近来,神经近似动态规划(NeurADP)采用价值分解与近似动态规划(ADP)相结合,通过考虑单个智能体(车辆)所选动作对该智能体未来价值的影响,优于主流方法。然而,为确保可扩展性并支持城市级拼车,NeurADP 完全忽略了其他智能体动作对个体智能体/车辆价值的影响。正如我们的实验结果所表明的,当车辆间对需求的竞争加剧时,忽略其他智能体动作对个体价值的影响会对整体性能产生显著影响。我们的关键贡献是一种基于通过联合条件概率计算条件期望的新机制,用于捕捉对其他智能体动作的依赖,且不增加训练或决策的复杂度。我们表明,我们的新方法——基于条件期望的价值分解(CEVD)——在整体服务请求数方面比 NeurADP 高出至多 9.76%,这是在城市级基准出租车数据集上的显著改进。
引用
@article{arxiv.2112.00579,
title = {Conditional Expectation based Value Decomposition for Scalable On-Demand Ride Pooling},
author = {Avinandan Bose and Pradeep Varakantham},
journal= {arXiv preprint arXiv:2112.00579},
year = {2021}
}
备注
Preprint. Under Review. arXiv admin note: text overlap with arXiv:1911.08842