中文

基于线性函数逼近的多智能体拥堵代价最小化

机器学习 2023-02-24 v2 人工智能 多智能体系统

摘要

本工作考虑多个智能体从源节点穿越网络到达目标节点。智能体在链路上通行的代价包含私有部分与拥堵部分。智能体的目标是以去中心化方式找到一条通往目标节点且总代价最小的路径。我们将其建模为一个完全去中心化的多智能体强化学习问题,并提出了一种新颖的多智能体拥堵代价最小化(MACCM)算法。我们的 MACCM 算法使用转移概率与全局代价函数的线性函数逼近。在缺乏中心控制器且为保护隐私的情况下,智能体通过时变通信网络将代价函数参数传递给邻居。此外,每个智能体维护其对全局状态-动作价值的估计,并通过多智能体扩展值迭代(MAEVI)子程序更新。我们证明了 MACCM 算法实现了次线性后悔界。证明需要代价函数参数的收敛性、MAEVI 算法的收敛性,以及由每个智能体的 MAEVI 触发条件引起的后悔界分析。我们在具有多条链路的两节点网络上实现该算法以进行验证。我们首先确定了最优策略,即每个时段前往目标节点的最优智能体数量。我们观察到对于 2 和 3 个智能体,平均后悔接近零。最优策略刻画了停留在节点的极小代价与前往目标节点的拥堵代价之间的权衡。我们的工作是对随机最短路径问题学习的推广。

关键词

引用

@article{arxiv.2301.10993,
  title  = {Multi-Agent Congestion Cost Minimization With Linear Function Approximations},
  author = {Prashant Trivedi and Nandyala Hemachandra},
  journal= {arXiv preprint arXiv:2301.10993},
  year   = {2023}
}

备注

Accepted at International Conference on Artificial Intelligence and Statistics (AISTATS) 2023