中文

大状态空间深度强化学习中基于近似鞅过程的方法以减少方差

机器学习 2022-11-30 v1 多智能体系统 最优化与控制

摘要

近似鞅过程(AMP)已被证明在特定情形(如多类排队网络)下对强化学习(RL)中的方差减少是有效的。然而,在已被证明的案例中,状态空间相对较小且所有可能的状态转移均可被遍历。在本文中,我们考虑状态空间较大且在考虑状态转移时存在不确定性的系统,从而使AMP成为RL中一种广义的方差减少方法。具体而言,我们将研究AMP在诸如Uber等网约车系统中的应用,其中结合了近端策略优化(PPO)来优化司机与乘客匹配的策略。

关键词

引用

@article{arxiv.2211.15886,
  title  = {Approximating Martingale Process for Variance Reduction in Deep Reinforcement Learning with Large State Space},
  author = {Charlie Ruan},
  journal= {arXiv preprint arXiv:2211.15886},
  year   = {2022}
}