中文

具有局部控制与全局状态信息的随机动态团队及博弈中最优性的分散学习

最优化与控制 2024-03-28 v4

摘要

随机动态团队与博弈是丰富的分散系统模型,也是多智能体学习的具有挑战性的试验场。先前保证团队最优性的工作假设了无状态动力学、显式协调机制或联合控制共享。在本文中,我们提出一种算法,可保证在团队和共同利益博弈中收敛到团队最优策略。该算法是一种双时间尺度方法,在较细时间尺度上使用 Q-learning 的变体进行策略评估,同时在较粗时间尺度上探索策略空间。遵循该算法的智能体是“独立学习者”:它们仅使用局部控制、局部代价实现和全局状态信息,而无法访问其他智能体的控制。据我们所知,此处给出的结果是首个使用独立学习者在随机动态团队和共同利益博弈中给出收敛到团队最优性的形式化保证。

关键词

引用

@article{arxiv.1903.05812,
  title  = {Decentralized Learning for Optimality in Stochastic Dynamic Teams and Games with Local Control and Global State Information},
  author = {Bora Yongacoglu and Gürdal Arslan and Serdar Yüksel},
  journal= {arXiv preprint arXiv:1903.05812},
  year   = {2024}
}