大状态空间深度强化学习中基于近似鞅过程的方法以减少方差
机器学习
2022-11-30 v1 多智能体系统
最优化与控制
摘要
近似鞅过程(AMP)已被证明在特定情形(如多类排队网络)下对强化学习(RL)中的方差减少是有效的。然而,在已被证明的案例中,状态空间相对较小且所有可能的状态转移均可被遍历。在本文中,我们考虑状态空间较大且在考虑状态转移时存在不确定性的系统,从而使AMP成为RL中一种广义的方差减少方法。具体而言,我们将研究AMP在诸如Uber等网约车系统中的应用,其中结合了近端策略优化(PPO)来优化司机与乘客匹配的策略。
引用
@article{arxiv.2211.15886,
title = {Approximating Martingale Process for Variance Reduction in Deep Reinforcement Learning with Large State Space},
author = {Charlie Ruan},
journal= {arXiv preprint arXiv:2211.15886},
year = {2022}
}