线性函数近似下分散式时序差分学习有限时间估计误差的精确公式
机器学习
2022-04-22 v1 系统与控制
系统与控制
最优化与控制
摘要
在本文中,我们考虑多智能体强化学习(MARL)中的策略评估问题,并推导了带有线性函数近似的分散式时序差分(TD)学习有限时间均方估计误差的精确闭式公式。我们的分析基于如下事实:分散式 TD 学习方法可视为马尔可夫跳变线性系统(MJLS)。随后可应用标准 MJLS 理论来量化分散式 TD 方法在每一步的估计误差的均值与协方差矩阵。我们还讨论了精确公式对算法性能的多重启示。一个有趣的发现是,在充要条件稳定性条件下,均方 TD 估计误差将以特定指数速率收敛到精确极限。
引用
@article{arxiv.2204.09801,
title = {Exact Formulas for Finite-Time Estimation Errors of Decentralized Temporal Difference Learning with Linear Function Approximation},
author = {Xingang Guo and Bin Hu},
journal= {arXiv preprint arXiv:2204.09801},
year = {2022}
}