多智能体 rollout 算法与强化学习
机器学习
2020-04-15 v3 人工智能
多智能体系统
摘要
我们考虑有限与无限时域动态规划问题,其中每一阶段的控制由若干不同的决策组成,每个决策由一个智能体作出。我们引入一种方法,在每一阶段,每个智能体的决策通过执行一个局部 rollout 算法作出,该算法使用一个基策略以及来自其他智能体的某些协调信息。每个智能体在每一阶段所需的局部计算量与智能体数量无关,而总计算量(所有智能体之和)随智能体数量线性增长。相比之下,标准 rollout 算法的总计算量随智能体数量指数增长。尽管所需计算量大幅减少,我们表明我们的算法具有 rollout 的基本代价改进性质:相对于基策略的性能改进。我们还讨论了通过有限的智能体协调与智能体计算的并行化来进一步提高方法计算效率的可能性。最后,我们探讨无限时域问题的相关近似策略迭代算法,并证明代价改进性质引导算法收敛到逐智能体最优策略。
引用
@article{arxiv.1910.00120,
title = {Multiagent Rollout Algorithms and Reinforcement Learning},
author = {Dimitri Bertsekas},
journal= {arXiv preprint arXiv:1910.00120},
year = {2020}
}