中文

通过强化学习的联盟议价:在协作车辆路径中的应用

机器学习 2023-10-27 v1

摘要

协作车辆路径是指配送公司通过共享配送信息并代为执行彼此的配送请求来进行合作。这实现了规模经济,从而降低成本、温室气体排放与道路拥堵。但哪家公司该与谁合作,且每家公司应获得多少补偿?传统的博弈论解概念,如 Shapley 值或核仁,由于特征函数随智能体数量呈指数级增长,难以针对现实世界的协作车辆路径问题进行计算。这将需要以指数次数求解车辆路径问题(一个 NP 难问题)。因此我们提议将这一问题建模为联盟议价博弈,其中关键在于智能体不被赋予特征函数的访问权限。相反,我们隐式地推理特征函数,从而消除以指数次数评估 VRP 的需要——我们仅需评估一次。我们的贡献在于我们的去中心化方法既可扩展又考虑了公司的自利本性。智能体使用改进的独立近端策略优化进行学习。我们的 RL 智能体优于一个强启发式 bot。智能体在 79% 的情况下正确识别最优联盟,平均最优性差距为 4.2%,运行时间减少 62%。

关键词

引用

@article{arxiv.2310.17458,
  title  = {Coalitional Bargaining via Reinforcement Learning: An Application to Collaborative Vehicle Routing},
  author = {Stephen Mak and Liming Xu and Tim Pearce and Michael Ostroumov and Alexandra Brintrup},
  journal= {arXiv preprint arXiv:2310.17458},
  year   = {2023}
}

备注

Accepted to NeurIPS 2021 Workshop on Cooperative AI