近似多智能体拟合 Q 迭代
机器学习
2023-04-06 v5 系统与控制
系统与控制
摘要
我们提出了一种高效的多智能体批量强化学习近似方法——近似多智能体拟合 Q 迭代(AMAFQI)。我们给出了该方法的详细推导。我们提出一种迭代策略搜索,并证明其对中心化已学习 Q 函数的多个近似而言可得到贪婪策略。在每次迭代与策略评估中,AMAFQI 所需计算量随智能体数量线性增长,而批量强化学习中常用方法拟合 Q 迭代(FQI)的相应计算量则随智能体数量指数增长。AMAFQI 的这一特性对于设计可处理的多智能体方法至关重要。我们在数值仿真中评估了 AMAFQI 的性能,并与 FQI 进行比较。仿真表明,在多智能体问题中使用 AMAFQI 替代 FQI 可显著减少计算时间,并印证了两种方法性能相近。
引用
@article{arxiv.2104.09343,
title = {Approximated Multi-Agent Fitted Q Iteration},
author = {Antoine Lesage-Landry and Duncan S. Callaway},
journal= {arXiv preprint arXiv:2104.09343},
year = {2023}
}