中文

元强化学习中梯度偏差的理论理解

机器学习 2024-03-26 v4 人工智能

摘要

基于梯度的元强化学习(GMRL)指的是维持双层优化过程的方法,其中外循环元学习器引导内循环基于梯度的强化学习器实现快速适应。在本文中,我们开发了一个统一框架来描述GMRL算法的变体,并指出GMRL采用的现有随机元梯度估计量实际上是有偏的。此类元梯度偏差来自两个来源:1)由双层问题结构引起的组合偏差,其关于内循环更新步数KK、学习率α\alpha、估计方差σ^In2\hat{\sigma}^{2}_{\text{In}}和样本量τ|\tau|的上界为O(KαKσ^Inτ0.5)\mathcal{O}\big(K\alpha^{K}\hat{\sigma}_{\text{In}}|\tau|^{-0.5}\big);2)由于使用autodiff导致的多步Hessian估计偏差Δ^H\hat{\Delta}_{H},其对元梯度偏差具有O((K1)(Δ^H)K1)\mathcal{O}\big((K-1)(\hat{\Delta}_{H})^{K-1}\big)的多项式影响。我们在表格MDP上进行了实证研究,并提供了证实我们对现有随机元梯度估计量理论发现的定量证据。此外,我们在迭代囚徒困境和Atari游戏上进行了实验,以展示如离策略学习和低偏差估计量等方法如何帮助一般地修正GMRL算法的梯度偏差。

关键词

引用

@article{arxiv.2112.15400,
  title  = {A Theoretical Understanding of Gradient Bias in Meta-Reinforcement Learning},
  author = {Xidong Feng and Bo Liu and Jie Ren and Luo Mai and Rui Zhu and Haifeng Zhang and Jun Wang and Yaodong Yang},
  journal= {arXiv preprint arXiv:2112.15400},
  year   = {2024}
}

备注

NeurIPS 2022