中文

匿名多智能体环境下的基于熵的独立学习

机器学习 2020-02-04 v4 人工智能 机器学习

摘要

供需之间的高效顺序匹配是许多线上到线下服务中备受关注的问题。例如,Uber、Lyft、Grab 用于将出租车匹配给乘客;Ubereats、Deliveroo、FoodPanda 等用于将餐厅匹配给顾客。在这些线上到线下服务问题中,负责供给的个体(例如出租车司机、送货自行车或送货面包车司机)通过在“正确”的时间出现在“正确”的地点来赚取更多收益。我们感兴趣的是开发一些方法,这些方法能够学习在存在其他类似“学习”个体且仅能局部聚合观测其他智能体状态(例如,仅知道与当前智能体处于同一区域的其他出租车数量)的情况下,引导个体在“正确”的时间出现在“正确”的地点(以最大化收益)。我们感兴趣领域的一个关键特征是个体之间的交互是匿名的,即交互(竞争需求)的结果仅取决于智能体的数量而非身份。我们使用匿名 MARL (AyMARL) 模型对这些问题进行建模。本文的关键贡献在于采用最大熵原理,提供了一个独立学习的通用框架,该框架在经验上是有效的(即使仅有关于智能体群体分布的局部聚合信息),并且在理论上是合理的。最后,与现有方法相比,我们的方法在用于线上到线下服务的通用模拟器和现实世界出租车问题上,在联合收益和个体收益方面均提供了显著提升。更重要的是,这是在学习的个体所获收益方差最小的情况下实现的,这是公平性的一种体现。

关键词

引用

@article{arxiv.1803.09928,
  title  = {Entropy based Independent Learning in Anonymous Multi-Agent Settings},
  author = {Tanvi Verma and Pradeep Varakantham and Hoong Chuin Lau},
  journal= {arXiv preprint arXiv:1803.09928},
  year   = {2020}
}