中文

安全的基于模型的多智能体平均场强化学习

机器学习 2023-12-29 v2 人工智能 多智能体系统 机器学习

摘要

许多应用(例如共享出行)需要协调大量智能体。平均场强化学习通过优化一个代表性智能体与无限多相同智能体群体交互的策略,而非考虑个体两两交互,来解决由此产生的可扩展性挑战。在本文中,我们处理一种重要的推广情形:存在对智能体分布的全局约束(例如要求满足容量约束或最低覆盖要求)。我们提出Safe-M3^3-UCRL,这是首个基于模型的平均场强化学习算法,即便在转移未知的情况下也能获得安全策略。其关键要素是在对数障碍方法中利用转移模型的认知不确定性,以高概率确保悲观约束的满足。除合成群体运动基准外,我们在许多共享出行运营商面临的车辆重新定位问题上展示了Safe-M3^3-UCRL,并基于深圳某服务提供商车辆轨迹数据构建的仿真评估其性能。我们的算法有效满足了关键区域的需求,同时保障了低需求区域的服务可及性。

关键词

引用

@article{arxiv.2306.17052,
  title  = {Safe Model-Based Multi-Agent Mean-Field Reinforcement Learning},
  author = {Matej Jusup and Barna Pásztor and Tadeusz Janik and Kenan Zhang and Francesco Corman and Andreas Krause and Ilija Bogunovic},
  journal= {arXiv preprint arXiv:2306.17052},
  year   = {2023}
}

备注

23 pages, 26 figures, 6 tables